不写文字的 AI,Jev
Jev picks one of your predefined answers and attaches a probability instead of writing text; a week of outside measurements shows where that is fast and cheap, and where it is not good enough.
TypeSafe AI released Jev in early access on 15 September 2026 with $40M in seed funding led by DCVC; it returns typed decisions with probabilities instead of text, at $0.042 per million input tokens with free output. Its "cannot hallucinate" claim only guarantees the answer's shape, and the game demos (Doom, Minecraft, a drone simulator, a flight search) all read game state written as text, with builder-reported numbers that nobody has reproduced. Independent tests found it level with small OpenAI models on short-text classification at a fraction of the cost, but weak on long documents, arithmetic and multi-step problems, and trustworthy mainly at its confident extremes. For a small game studio it looks like a fast gate inside a loop, not a replacement for rules or reasoning models, and TypeSafe itself says Korean is handled "not equally well".
2026 年 9 月 15 日发布的 Jev,是一个一行文字都不写的 AI 模型。它只从你事先定好的选项里挑一个,再附上一个概率,所以又快又便宜。它玩游戏的演示引来了一片关注,但一周里积累起来的外部测量,已经能看清它做得好的事和做不好的事。
我们做游戏。所以“AI 玩 Doom”的视频传开时,我们最先想知道的是:这个速度和价格,真能在游戏里用吗?我们把一周的材料收了收,整理成这篇。
发布了什么
事实 旧金山的 TypeSafe AI 在 2026 年 9 月 15 日以抢先体验的方式发布了首个模型 Jev。同一天,它带着 DCVC 领投的 4000 万美元种子轮融资走出隐身状态(TypeSafe 发布文章,2026 年 9 月 22 日查阅)。等候名单在 2026 年 9 月 20 日(UTC)由官方账号的公告取消。
事实 公司把创始人迪奥戈·阿尔梅达(Diogo Almeida)介绍为“ChatGPT 的共同发明人”。能核实的是,他在 OpenAI 2022 年的 InstructGPT 论文里是 20 位作者中的第四位(arXiv 2203.02155)。他本人的说法要保守些:在自己的文章里,他写的是“参与了”指令遵循方法的构建。
名字来自两处。一是卡尼曼的“系统 1”,指快速、直觉的思考;二是杰文斯悖论——效率越高,消耗越多。公司把 Jev 称作一个新类别:“System One 模型”。
它怎么工作
事实 一次请求里要送上写成文本或 JSON 的情境(state),再加一个答案形态已经事先定好的问题。问题有三种:从选项里挑一个、打分、是或否。回来的只有选中的答案和一个概率,没有句子(TypeSafe 文档,2026 年 9 月 22 日查阅)。
事实 价格是每 100 万输入 token 0.042 美元,输出免费。输入只收文本,图像、语音、视频还不支持。一次请求最多 64,000 个 token,其中情境加最长的那个问题合起来最多 32,000 个(模型文档,2026 年 9 月 22 日查阅)。
事实 速度的说法各个渠道不一样。发布文章说比现有模型快 40 到 200 倍,响应 70 到 500 毫秒;主页说快 193.6 倍、便宜 444.6 倍;新闻稿说最多 100 倍。公司自己也写了,主页的数字出自自家评测,大概是“实际收益的高端”(发布文章,2026 年 9 月 22 日查阅)。
“没有幻觉”是什么意思
这是发布时最大的争论点。先说结论:它只保证答案的形态。
事实 公司的常见问题页写着,Jev“保证答案的形态,但不保证每一次判断都正确”。给它一份选项列表,它编不出列表之外的答案,但可以挑错(TypeSafe 主页,2026 年 9 月 22 日查阅)。CEO 也在 Hacker News 上承认,它“可以很自信地出错”。
事实 开发者阿明·罗纳赫(Armin Ronacher)对 TechCrunch 说,这个模型“把幻觉问题往用户那边推了一点”。意思是,概率 50% 时怎么办、95% 时怎么办,要由调用的一方来定(TechCrunch,2026 年 9 月 18 日)。
游戏演示展示了什么
传开的视频大多是游戏。它们有一个共同点。模型没有看画面。是有人把游戏状态写成文本喂进去的。
- 事实 Doom 是 TypeSafe 自己做的演示。它把游戏状态当作文本数据收下,每秒判断十次左右,按公司自己的算法每小时约 7 美元。公司自己写道,“一个不是 AI 的脚本机器人可能做得更好”(发布文章)。
- 事实 Minecraft 由外部开发者制作。用 338 个方块立起一面加拿大国旗,在 16 分 31 秒里做了 2,266 次判断;更早一次运行里测到的请求往返平均 128 毫秒。他自己写道,这是一次成功,不是可以重复的证据(仓库,2026 年 9 月 22 日查阅)。
- 事实 无人机模拟器里,摄像头画面由普通的视觉代码转成 JSON,安全反应由另一段代码每秒单独处理 50 次。Jev 只负责每秒选 2.5 次方向:65 秒里调用 80 次,中位数 0.11 秒——同样只是一次运行(仓库,2026 年 9 月 22 日查阅)。
- 事实 网页代理公司 Browser Use 用 7.1 秒、0.0039 美元跑完了一次谷歌机票搜索。它没有走到下单那一步,并说这个数字来自把同一个任务跑了三次(仓库,2026 年 9 月 22 日查阅)。
事实 一份收集了发布后四天里 12,759 条推文的分析中,用户自己报告的提速中位数是 7 倍,和主页的 193.6 倍有距离(OpenChamber,2026 年 9 月 22 日查阅)。游戏演示里,有第三方复现并给出自己结果的,我们还没找到。
外面测出的结果
事实 最详细的结果来自开发者阿曼·库马尔(Aman Kumar),他大约调用了 1.6 万次。在短文本分类上,四个公开数据集里有三个与 OpenAI 的小模型持平或更好,成本低 5 到 56 倍。在分成 77 类的银行咨询分类上,它以 76.0% 落败。要读完整篇文档的活儿,它不如他现在用的小模型,改提示词也没有变好(他的测量文章,2026 年 9 月 18 日)。
事实 他最后定下的用法是这样:概率在 0.9 以上的答案,在公开数据集上约有 96% 是对的,中间区间则接近掷硬币。所以两端可以信,中间交给能认真读文档的模型。另外,一次送 100 条时,千次里有几次要花 10 到 35 秒(同一篇文章)。
事实 就算在公司自己的评测里,Jev 的准确率也不是第一。四种工作流平均 67.8%,低于最准的模型的 74.1%。作为交换,它每条 0.0004 美元、0.4 秒,比那个模型的 0.0836 美元和 23.3 秒便宜得多、也快得多(TypeSafe 评测页,2026 年 9 月 22 日查阅)。公司自己的文档也把弱项直接写了下来:计算和计数、比较日期、要跨好几个步骤的推理、塞满无关内容的长输入,以及混进输入里的攻击性措辞(弱项文档,2026 年 9 月 17 日修订版)。
事实 Hacker News 上的发布文章拿到 1,941 分和 509 条评论(2026 年 9 月 21 日 16:50 UTC,Hacker News)。反应分得很开:没有公开架构、没有附上公开基准测试,后面还跟着一连串用开源模仿它的项目。
一家小游戏工作室看到的位置
从这里开始是我们自己的想法。Jev 不是替你设计游戏的工具,它更像一个零件:接下情境,快速挑出“现在这些里该做哪个”。这样看,游戏这边能想到几个位置。
- 游戏循环里的短判断。 NPC 是逃还是打、捡哪个道具,这类选项已经定好的决定。不过正如 Doom 演示所示,把游戏状态写成文本是我们的活,而且脚本做得更好的地方也不少。
- 自动化试玩测试。让按按钮的机器人便宜地多跑几百局。它玩得不会有人好,但要找出玩家卡住的地方,局数才是关键。
- 短文本判定。比如过滤排行榜昵称这样的是非题。按阿曼·库马尔的建议,只把有把握的一端自动处理,其余交给别的办法,看起来是对的。
让我们在意的地方也很清楚。公司的文档写着,包括韩语在内的中日韩文字“能处理,但不是同样好”,而用韩语测出的结果我们还没找到。服务器在美国西海岸,从韩国调用会比公布的延迟更慢。权重没有公开,默认版本名会在新模型出来时悄悄换掉。免费的输出价格能撑多久,公司自己也写了“需要长期证明”。
所以我们的结论是:当作快速的直觉可以用,把整个判断交给它还太早。规则能做的事交给规则,要长时间想的事交给会思考的模型。夹在中间那些又短又频繁的选择,才是 Jev 的位置。