这个问题几乎总是一个模样:“我该用哪个?” 提问的人几乎总是想要一个具体的名字。

在这里你得不到答案。不是因为怕说,而是因为大约一年以来,诚实的答案已经变了:对大多数任务而言,三个顶尖模型之间的差距,比一个问得好和问得差的问题之间的差距还要小。而在确实存在明显差异的地方,那差异很少出现在对比表格去找的地方。

所以这不是一份排名,而是一份按任务给出的判断——附带一个”截至”日期,因为这篇文章是有保质期的。

自我披露

这篇文章的初稿是用 Claude 写的。这件事该摆在台面上,然后才轮到本文说哪个模型在什么地方更强。

由此有两点。第一,每一个数字背后都有一个你可以自己打开查看的来源——没有一个来自对比网站,全部来自各家自己的价格页面、文档,或者具名的观察者。第二,这篇文章不为任何模型加冕。凡是我的看法,都会标明是看法。

还有:这里没有任何联盟链接。也不可能有——OpenAI、Anthropic 和 Google 根本不做合作伙伴计划。这一点在这件事上,反倒让事情简单得让人愉快。

现在有什么可用

What's available right now

ChatGPT OpenAI

GPT-5.6 Sol

Top model, coding and agents

$5 / $30 1,050,000 tokens 9 July 2026

Knowledge cutoff 16 February 2026 — anything later it only knows if it searches.

GPT-5.6 Terra

Everyday work

$2.50 / $15 1,050,000 tokens 9 July 2026

The model the free and Go tiers run on.

GPT-5.6 Luna

Fast and cheap

$1 / $6 1,050,000 tokens 9 July 2026

Claude Anthropic

Claude Fable 5

Strongest model, long-horizon work

$10 / $50 1,000,000 tokens 2026

Requires 30-day data retention — not available under zero data retention.

Claude Opus 4.8

Coding and agents

$5 / $25 1,000,000 tokens 2026

Claude Sonnet 5

Everyday work

$3 / $15 1,000,000 tokens 2026

Introductory price 2 / 10 until 31 August 2026.

Claude Haiku 4.5

Fast and cheap

$1 / $5 200,000 tokens 2025

The only model in this field without a million-token context.

Gemini Google

Gemini 3.6 Flash

Workhorse

$1.50 / $7.50 1,048,576 tokens 21 July 2026

17% cheaper on output than 3.5 Flash — Google's current default model.

Gemini 3.5 Flash

Predecessor, still available

$1.50 / $9 1,048,576 tokens 19 May 2026

Gemini 3.5 Flash-Lite

High-volume work

$0.30 / $2.50 1,048,576 tokens 21 July 2026

The cheapest output price in the whole field.

Gemini 3.1 Pro

Google's largest model — still labelled preview

$2–$4 / $12–$18 1,048,576 tokens 2026

Price rises above a 200,000-token prompt. The announced successor 3.5 Pro still hasn't shipped two months after the announcement.

Price per token says less than it promises: the models think for different lengths of time, and those thinking tokens are on the same bill. The cheaper model can be the more expensive job.

截至 24 July 2026。价格为美元列表价,未计入批量处理或缓存折扣——这两项能显著降低三家的费用。做决定前请务必直接向服务商核实。

把它们并排放在一起看,有两件事很突出。

上下文窗口已经不再是一个卖点了。 两年来,“能装下多少文字”一直是最强的区分标准。如今三家都在大约一百万 token 上下——差不多相当于70万个词,一次能装下好几本厚长篇小说。只有最小的那款 Claude 模型例外,只有20万。如今还按上下文窗口来选,等于是在按一个各家早已清空的标准做决定。

Google 最大的模型,名字里挂着”预览版”已经好几个月了。 5月19日,Google 在自己的开发者大会上宣布了 Gemini 3.5 Pro——“内部已经在用”,将于”下个月”发布。7月21日,两个月后,来的却是三款新模型,没有一款是 3.5 Pro。Google 目前可用的最强模型,版本号仍然停留在 3.1,名字里还带着”Preview”。其余能用的全是 Flash 模型——也就是那个又快又便宜的档次。

这算不上丑闻,但确实是一种规律:这三家都是如此——宣布的是一份清单,能买到的是另一份。

按任务做决定

写代码,以及长时间的自主任务

这是争议最大的一项——而这些跑分并不是互相矛盾,它们只是在衡量不同的东西。

Claude Opus 4.8 在 SWE-Bench Pro(真实的 GitHub 问题)上以 69.2% 的成绩领先。GPT-5.6 Sol 在”Agents’ Last Exam”上创下 53.6 的新高,明显领先于 Claude Fable 5。Gemini 3.5 Flash 在 Terminal-Bench 2.1 上报出 76.2%。三场考试,三个赢家。

Simon Willison 这三个模型每天都在用,多年来一直冷静地写关于它们的文章。GPT-5.6 发布后,他这样说:尽管跑分刷新了纪录,但在复杂的编程任务上,这个模型给他的感觉并没有比 Claude Fable 更好。

我的建议: 这里不要按模型来决定,按围绕它的工具来决定——它跟你的编辑器、终端、习惯配合得有多顺手。模型之间的差距,比它们运行所在的那些环境之间的差距要小。

图像、视频、音频

唯一有明确答案的一项:Google。

在这三家里,只有 Google 把图像和视频生成放在跟语言模型同一张价目表上——Veo 3.1 起价每秒视频 0.05 美元,Imagen 4 起价每张图片 0.02 美元。此外还有 Gemini Omni,一款视频模型,你可以在多轮对话里持续编辑它,它还会记住你们之前在这次会话里聊过什么。

如果你的主业是媒体,这件事没什么好纠结的。

阅读和总结长文档

无所谓。是真的无所谓。见上文——三家都能一口气吞下几百页。手边打开着哪个,就用哪个。

大量自动化的小任务

Gemini 3.5 Flash-Lite 拥有全场最低的输出价格,每百万 token 输入 0.30 美元、输出 2.50 美元——比另外两家的小模型便宜两到三倍。

但这笔账要小心算,见下一节。

如果你已经活在 Google 生态里

全场入门门槛最低的是 Google AI Plus,4.99 美元——外加 400 GB 存储空间。Google 19.99 美元档还包含 YouTube Premium Lite。

这才是 Google 在个人用户里胜出的真正原因,跟模型质量没什么关系。如果你反正要为存储和 YouTube 付费,这笔账上 AI 几乎等于白送。

如果你的工作需要考虑数据保护

这个细节几乎没有出现在任何对比里:Anthropic 最强的模型 Fable 5 需要 30 天的数据保留期,在零数据保留(zero data retention)模式下完全不可用。如果你所在的律所、诊所或客户明确要求零保留,旗舰模型就出局了——你会落到 Opus 4.8,而不是 Fable。

这种细节写在开发者文档里,不会出现在产品页面上。

跑分没有告诉你的事

按 token 计价这个衡量标准已经失效了。 模型在回答之前会先”思考”,这些思考用掉的 token 跟答案算在同一张账单里。一个 token 单价只有一半、但思考时间长三倍的模型,到月底反而更贵。Willison 说的正是这个意思:单纯比较每 token 的价格,如今已经会误导人。真想知道一件事到底要花多少钱,得把自己典型的任务分别丢给这三家跑一遍,看账单——而不是看价目表。

考试是由考生自己打分的。 OpenAI 的模型在 SWE-Bench Pro 上落后于 Anthropic 之后,OpenAI 发表了一篇对这项跑分的批评——估计其中大约 30% 的任务本身就有问题。这在事实层面也许完全正确。但这仍然是一个当事人在为自己作证。同样的警惕也适用于反方向:凡是为自己领先的某项跑分欢呼的一方,同样有利害关系。

而从 2026 年 7 月起,一款模型什么时候发布,已经不再只由厂商一家说了算。 GPT-5.6 是在美国政府机构——商务部下属的 Center for AI Standards and Innovation——完成审查之后,才获准大范围发布的。这件事对未来几年的意义,比这篇文章里的任何一个百分比都大。

要花多少钱

What it costs

ChatGPT OpenAI

ChatGPT Go

€8 / month

The cheap middle tier. Runs on Terra.

ChatGPT Plus

€23 / month

The plan most people mean. Free choice of model.

ChatGPT Pro

€229 / month

For constant use and Sol reasoning without a tight cap.

Claude Anthropic

Claude Pro

$20 / month ($17 billed annually)

Includes Claude Code. No cheaper middle tier exists.

Claude Max

from $100 / month ($200 for 20×)

5× or 20× Pro's usage limits. Same models.

Gemini Google

Google AI Plus

$4.99 / month

The cheapest entry in the field, incl. 400 GB storage.

Google AI Pro

$19.99 / month

Plus YouTube Premium Lite and storage — the bundle is the argument.

Google AI Ultra

$99.99 / month ($199.99 for 20×)

5× or 20× Pro's limits, 20 TB storage.

截至 24 July 2026。OpenAI 针对德国以欧元报价,Anthropic 和 Google 则以美元报价——因此这里的两种货币均按各服务商公布的原样列出。

最突出的落差是:Claude 没有便宜的中间档。 它直接从免费跳到 20 美元。ChatGPT 有 8 欧元的 Go,Google AI Plus 是 4.99 美元。如果你经常用 AI,但不是职业需要,Anthropic 这里根本没有适合你的档位。

反过来说:Claude Pro 免费包含 Claude Code,也就是那个编程工具。在意这一点的人,早就知道了。

为什么这篇文章有保质期

看看这个速度。

OpenAI:2025 年 11 月发布 GPT-5.1,12 月 5.2,2026 年 3 月 5.4,4 月 23 日 5.5,7 月 9 日 5.6。八个月里出了五代。

Google:5 月 19 日 Gemini 3.5 Flash,7 月 21 日 Gemini 3.6 Flash。两个月。

这在实际中意味着:年费套餐赌的不是一个模型,而是一个厂商——你选中的这个模型,一年后就不会再是现在这个样子了。Anthropic 打的广告是年付 17 美元而不是 20 美元;这是用十二个月不能反悔换来的 36 美元。而在这样一个每八周就冒出一款新旗舰的领域里,这笔交易并不划算。

按月付费。 这是整篇文章里最实用的一条建议。

我的看法

如果你想要一个答案、懒得再想了:选那个界面最不碍事的。质量上的差异,对你工作的影响,远不如你愿不愿意打开这个东西来得大。

如果你能同时付两份钱,明智的组合不是”最好的加上第二好的”——而是一个管文字和代码,一个管媒体——在第二个位置上,Google 几乎没有对手。

如果三个月后你又开始怀疑自己当初选得对不对:到那时这篇文章会已经更新过了。文末的版本记录会告诉你改了什么。

至于模型周围的那些工具——图像、视频、音乐、剪辑、自动化——我另外维护着一份持续更新的 137 个 AI 工具索引

信息来源

全部于 2026 年 7 月 24 日核实。

如果这里有什么在你看来已经过时或者错了:联系我。上面那个日期,就是为这个准备的。