— Blog · ノート

文章を書かない AI、Jev

Jev picks one of your predefined answers and attaches a probability instead of writing text; a week of outside measurements shows where that is fast and cheap, and where it is not good enough.

TL;DR · English

TypeSafe AI released Jev in early access on 15 September 2026 with $40M in seed funding led by DCVC; it returns typed decisions with probabilities instead of text, at $0.042 per million input tokens with free output. Its "cannot hallucinate" claim only guarantees the answer's shape, and the game demos (Doom, Minecraft, a drone simulator, a flight search) all read game state written as text, with builder-reported numbers that nobody has reproduced. Independent tests found it level with small OpenAI models on short-text classification at a fraction of the cost, but weak on long documents, arithmetic and multi-step problems, and trustworthy mainly at its confident extremes. For a small game studio it looks like a fast gate inside a loop, not a replacement for rules or reasoning models, and TypeSafe itself says Korean is handled "not equally well".

2026年9月15日に公開された Jev は、文章を一行も書かない AI モデルです。あらかじめ決めておいた選択肢から一つを選び、確率を付けて返すだけなので、速くて安く済みます。ゲームをプレイするデモで話題になりましたが、一週間で集まった外部の測定を見ると、得意なことと不得意なことがはっきり分かれています。

私たちはゲームを作っています。だから「AI が Doom をプレイする」という動画が出回ったとき、まず気になったのはそこでした。これは、ゲームの中で実際に使える速度と値段なのか。一週間分の資料を集めて整理しました。

何が公開されたか

事実 サンフランシスコの TypeSafe AI が2026年9月15日、最初のモデル Jev をアーリーアクセスで公開しました。同じ日に、DCVC が主導した4,000万ドルのシード投資とともに、ステルスを抜けて姿を現しています(TypeSafe の公開記事、2026年9月22日閲覧)。順番待ちリストは2026年9月20日(UTC)の公式アカウントの告知でなくなりました。

事実 会社は創業者のディオゴ・アルメイダ(Diogo Almeida)を「ChatGPT の共同発明者」と紹介しています。裏づけとして確認できるのは、OpenAI の2022年の InstructGPT 論文に20人中4番目の著者として名前があることです(arXiv 2203.02155)。本人は自身の記事で、指示に従わせる方法を「作るのに参加した」と、もう少し控えめに書いています。

名前の出どころは二つあります。速くて直感的な思考を指すカーネマンの「システム1」と、効率が良くなるほど消費が増えるというジェボンズのパラドックスです。会社は Jev を「System One モデル」という新しい種類だと呼んでいます。

仕組み

事実 リクエストには、状況を書いたテキストか JSON('state')と、答えの形をあらかじめ決めた質問を一緒に送ります。質問は、選択肢を選ぶ、点数を付ける、はい/いいえの三つです。返ってくるのは選んだ答えと確率だけで、文章はありません(TypeSafe のドキュメント、2026年9月22日閲覧)。

事実 値段は入力100万トークンあたり0.042ドルで、出力は無料です。入力はテキストだけを受け取り、画像・音声・動画はまだ使えません。1回のリクエストで6万4,000トークンまで、そのうち状況といちばん長い質問を合わせて3万2,000トークンまでです(モデルのドキュメント、2026年9月22日閲覧)。

事実 速度の主張は、出どころによって数字が違います。公開記事は既存のモデルより40〜200倍速く、応答は 70〜500 ms だとし、ホームページは193.6倍速く444.6倍安いとし、プレスリリースは最大100倍だとしています。会社自身も、ホームページの数字は自社の評価基準によるもので「実際に得られる差の、高いほうの端」だろうと書いています(公開記事、2026年9月22日閲覧)。

「幻覚がない」という言葉の意味

公開当時、いちばん大きな論点でした。結論から言うと、答えの形だけを保証します。

事実 会社のよくある質問のページには、Jev は「答えの形は保証するが、すべての判断が正しいとは保証しない」と書かれています。選択肢のリストを渡せば、その外の答えを作り出すことはできませんが、間違った答えを選ぶことはできる、という意味です(TypeSafe のホームページ、2026年9月22日閲覧)。代表も Hacker News で「自信を持って間違えることがある」と認めました。

事実 開発者のアルミン・ロナッハーは TechCrunch に、このモデルは「幻覚の問題を少しユーザーに押し付けている」と話しました。確率が50%のときと95%のときにどうするかは、使う側が決めなければならない、ということです(TechCrunch、2026年9月18日)。

ゲームのデモが見せたもの

話題になった動画は、ほとんどがゲームでした。共通点が一つあります。モデルは画面を見ていませんでした。誰かがゲームの状態をテキストに書き出して渡していたのです。

  • 事実 Doom は TypeSafe が自分で作ったデモです。ゲームの状態をテキストのデータで受け取り、1秒に10回ほど判断し、会社の計算で1時間あたり約7ドルかかります。会社自身が「AI ではないスクリプトのボットのほうがうまくやれる」と書いています(公開記事)。
  • 事実 Minecraft は外部の開発者が作りました。338個のブロックでカナダの国旗を組み上げるのに、16分31秒のあいだに2,266回判断し、先に行った実行で測ったリクエストの往復は平均 128 ms でした。一度うまくいっただけで、繰り返せる証拠ではないと本人が書いています(リポジトリ、2026年9月22日閲覧)。
  • 事実 ドローンのシミュレーターでは、カメラの映像を普通の画像処理コードが JSON に変え、安全のための反射的な動きは別のコードが1秒に50回受け持ちました。Jev は1秒に2.5回ほど方向を選ぶだけです。65秒のあいだに80回の呼び出し、中央値0.11秒で、これも一度きりの実行です(リポジトリ、2026年9月22日閲覧)。
  • 事実 ウェブエージェントの会社 Browser Use は、Google の航空券検索を7.1秒、0.0039ドルで終えました。予約まではせず、同じ作業を三回繰り返した結果だと明かしています(リポジトリ、2026年9月22日閲覧)。

事実 公開後の四日間のツイート1万2,759件を集めた分析では、利用者が自分で報告した速度の向上の中央値は7倍でした。ホームページの193.6倍とは距離があります(OpenChamber、2026年9月22日閲覧)。ゲームのデモのうち、第三者が再現して結果を出したものは、まだ見つけていません。

外から測った結果

事実 外からの測定でいちばん詳しいのは、開発者のアマン・クマールが約1万6,000回呼び出した結果です。短い文の分類では、公開データセット四つのうち三つで OpenAI の小型モデルと同じくらいか上回り、費用は5〜56倍安く済みました。銀行の問い合わせを77種類に分ける分類では76.0%で及びませんでした。文書の全体を読まなければならない仕事では、いま使っている小さなモデルより劣り、プロンプトを変えても良くなりませんでした(測定の記事、2026年9月18日)。

事実 彼がまとめた使い方はこうです。確率0.9以上の答えは公開データセットで約96%正しく、真ん中の区間はコイン投げに近いものでした。だから両端は信じて、真ん中は文書をきちんと読むモデルに渡せ、と言っています。同時に100件を送るときは、千回に数回の割合で10〜35秒かかりました(同じ記事)。

事実 会社自身の評価でも、Jev は正確さで1位ではありません。四つの業務の流れの平均で67.8%、いちばん正確なモデルの74.1%より低い数字です。代わりに1件あたり0.0004ドルと0.4秒で、そのモデルの0.0836ドルと23.3秒よりはるかに安く、速く済みます(TypeSafe の評価ページ、2026年9月22日閲覧)。会社のドキュメントも弱点をそのまま書いています。計算と数を数えること、日付の比較、いくつもの段階をまたぐ推論、関係のない内容が多い長い入力、入力に紛れ込んだ攻撃的な文言です(弱点のドキュメント、2026年9月17日改訂版)。

事実 Hacker News に載った公開記事は1,941点、コメントは509件が付きました(2026年9月21日16:50 UTC、Hacker News)。構造を公開しなかったこと、公開ベンチマークを載せなかったこと、似たモデルをオープンソースで真似た後続が次々に出てきたことまで、反応は大きく分かれました。

小さなゲームスタジオから見た居場所

ここからは私たちの考えです。Jev は、ゲームを代わりに設計してくれる道具ではありません。状況を受け取って「いまこの中で何をするか」を速く選ぶ部品に近いものです。そう見ると、ゲームのほうで思い浮かぶ場所がいくつかあります。

  • ゲームループの中の短い判断。 NPC が逃げるか戦うか、どのアイテムを拾うかのように、選択肢が決まっている決定です。ただし Doom のデモが見せるとおり、ゲームの状態をテキストに書き出す仕事は私たちの担当で、スクリプトのほうがうまくやる場所も多くあります。
  • 自動のプレイテスト。 ボタンを押すボットを安く何度も回す仕事です。人のようにうまくはできなくても、詰まる区間を見つけるには回数がものを言います。
  • 短い文の判定。 ランキングのニックネームのフィルターのような、はい/いいえの問題です。アマン・クマールの助言のとおり、確信が高いほうだけ自動で処理し、残りは別の方法に渡すやり方が合っていそうです。

引っかかるところもはっきりしています。会社のドキュメントは、韓国語を含む CJK の文字について「処理はするが、同じようにうまくはできない」と書いていますし、韓国語で測った結果はまだ見つけていません。サーバーがアメリカ西部にあるので、韓国から呼べば発表された遅延より遅くなるはずです。重みは公開されておらず、既定のバージョン名は新しいモデルが出ると静かに変わります。無料の出力価格が長く続くかどうかは、会社も「長期的に証明しなければならない」と書いています。

そこで私たちの結論はこうです。速い直感としては使えますが、判断の全体を任せるにはまだ早いです。規則でできることは規則でやり、長く考えなければならないことは考えるモデルに任せます。その間にある短くて頻繁な選択が、Jev の居場所です。