同一天相隔一小时,以及 218 天
Anthropic and OpenAI shipped frontier models an hour apart on 22 September 2026; Google has not shipped one in 218 days.
Two labs now set their release dates by watching each other: on 22 September 2026 Anthropic shipped Claude Opus 5.5 and OpenAI followed with GPT-6 Sol and Luna about an hour later. With capability too close to separate — Artificial Analysis ranked Opus 5.5 first of 210 models the same week METR called it a modest improvement, and a replay on a production TypeScript monorepo had Opus finish 13 of 20 runs cleanly at $45.81 against Sol's 8 of 20 at $13.16 — the fight moved to price: Opus tokens down 20% to $4/$20 against Sol's $2/$10. Google is not in that exchange. It has shipped no Pro-tier flagship since Gemini 3.1 Pro on 19 February 2026, 218 days, while shipping three Flash models in 43 days.
2026 年 9 月 22 日,Anthropic 和 OpenAI 相隔一小时发布了新模型。竞争先在价格上显现出来,而 Google 已经 218 天没有在这个位置上发过模型。
相隔一小时
事实 Anthropic 先发布了 Claude Opus 5.5,约一小时后 OpenAI 发布了 GPT-6 Sol 和 Luna(Simon Willison,2026 年 9 月 25 日查阅。Hacker News 上的发帖时间也是同样的顺序)。
事实 两则发布同时占据了 Hacker News 的首页,反响的规模也几乎一样(Opus 5.5 讨论帖、GPT-6 讨论帖,9 月 25 日查阅)。
两次发布的间隔不是一天,而是一小时。只能认为日期是双方看着对方定下的。
竞争表现在价格上
事实 每 100 万 token,Opus 5.5 是输入 $4 · 输出 $20 · 缓存读取 $0.20。上一代 Opus 5 是 $5 · $25 · $0.50——token 降了 20%,缓存读取降了 60%(Anthropic 价格文档,9 月 25 日查阅)。
事实 同一天,OpenAI 把 Sol 定在 $2 · $10,把 Luna 定在 $0.10 · $0.50(OpenAI API 文档,9 月 25 日查阅)。按这个价位,和 Opus 5.5 正面相撞的是 Sol。
不过两边发布文章里的数字都不能照单全收。Anthropic 在发布文章里说“跑起来便宜 40%”,但价格表上能确认的降幅是 20%。40% 是公司在自家的工作假设上算出来的值。OpenAI 的“降价 50%”则附有相对 GPT-5.6 的促销价这个前提。
事实 而且 Opus 5.5 关不掉思考,思考的 token 按输出计费。Anthropic 的文档也写着,以前关掉思考来跑的任务,每次请求的输出 token 可能会变多(Anthropic 迁移文档,9 月 25 日查阅)。一边下调标价,一边让模型说更多的话,实际花的钱不会按降价的幅度降下来。
性能,换一家来测就是另一个结果
事实 Artificial Analysis 把 Opus 5.5(max)排在 210 个模型里的第一位。智能指数 58 分,每项任务平均 $5.98(Artificial Analysis,9 月 25 日查阅)。
事实 同一周,METR 用五项长周期任务做了十天的事前评估,写道“不是大的跃升,但很可能是一次温和的改进”(METR,9 月 25 日查阅。同一页面写明这是在无报酬协议下做的)。
事实 拿真实代码正面比过的结果又是另一幅图景。在一个 3,700 个文件的 TypeScript monorepo 上,把 6 个已经合并的变更重新交给模型做,每个模型各跑 20 次,结果 Opus 5.5 干净通过 13 次、测试回归 0 次,花了 $45.81;Sol 通过 8 次、回归 5 次,花了 $13.16(paddo.dev,9 月 25 日查阅)。
三个结果出现在同一周。“第一名”、“温和的改进”、“贵三倍但更准”——没有哪一个是错的。只是测量的方法不同。领先的位置贴得这么近时,排行榜上的一行分不出高下。Anthropic 自己也在发布文章里写道,在这个水平上,很难用基准分数的差距去判断实际的差别。
Google 已经安静了 218 天
事实 Google 最后一个旗舰 Pro 模型是 2026 年 2 月 19 日的 Gemini 3.1 Pro。按 9 月 25 日算是 218 天前,而上一次旗舰之间的间隔是 93 天——约 2.3 倍,而且还没有结束。
事实 Gemini 3.5 Pro 在 5 月 19 日的 I/O 上被预告为 6 月推出,之后被推迟。据 Bloomberg 报道,为了提升编码能力,6 月底换掉了训练数据,结果令人失望(9to5Google,9 月 25 日查阅)。今天 DeepMind 的模型页面仍然把 3.1 Pro 放在 Pro 的位置上,把 3.5 Pro 标为“coming soon”(Google DeepMind,9 月 25 日查阅)。
在 Anthropic 和 OpenAI 相隔一小时相撞的这段时间里,Google 在同一量级上七个多月没有发过模型。
它改用 Flash 来打
事实 同一段时间里 Google 一直在发。只是全都是 Flash——7 月 21 日的 3.6 Flash、8 月 13 日的 3.7 Flash、9 月 2 日的 3.8 Flash,43 天里三个。在竞争对手扎堆发布的 9 月 22 日,它也正式公开了 3.8 Flash TTS(Gemini API 更新日志,9 月 25 日查阅)。
事实 那些 Flash 便宜。3.8 Flash 每 100 万 token 从输入 $0.75 · 输出 $3.75 起(Google 博客,9 月 25 日查阅)。这个市场卖的是能大批量跑的质量,价格本身就是战略。
一家 43 天里发三个模型的公司,在 Pro 的位置上 218 天什么也没能发出来。能快速发出来的东西,和能发到那个位置上的东西,不是同一种能力。
眼下在前沿定价格、定发布日期的是这两家公司。Google 把模型放上同一量级的那一天,这个算式会变。第七个月了,还没有。