三大厂商在同一个月密集调整API:这轮大模型API定价更新说明了什么
2026年6月下旬到7月下旬的一个月时间里,Anthropic、OpenAI、Google DeepMind先后完成了各自模型阵容的更新,大模型API定价与能力边界几乎同步发生变化:Claude Sonnet 5、Claude Opus 5、GPT-5.6家族、Gemini 3.6 Flash相继上线,上下文窗口、分词方式、限流分层、缓存计费规则都有实质调整。对正在用API构建产品的开发者来说,这不是一次孤立的模型更新,而是三条产品线同时重新校准了"每次调用到底值多少钱、能装多少上下文"这个问题的答案。
Anthropic:Opus 5价格没变,Sonnet 5换了计价规则
Opus 5用同样的价格换来更大的默认上下文
7月24日,Anthropic发布Claude Opus 5,官方称其为相对Claude Opus 4.8的"step-change"式提升。变化直接体现在两点:一是100万token上下文这次默认就是上限,不需要再单独开启;二是最大输出提高到12.8万token,并且默认开启thinking(推理)模式。价格维持在每百万token输入5美元、输出25美元,与Opus 4.8完全相同——对已经在用Opus系列的团队而言,换模型不需要重新做成本预算,但输出内容默认带推理过程,实际消耗的token量未必和过去一样。
Sonnet 5引入新分词器,同样字数会切出更多token
6月30日上线的Claude Sonnet 5同样支持100万token上下文、12.8万最大输出,采用引入期价格(每百万token输入2美元、输出10美元,截至8月31日),此后回到标准的3美元/15美元。开发者需要留意的细节是:Sonnet 5启用了新分词器,官方说明同一段文本切出的token数量会比旧模型多出约三成,具体幅度因内容和任务形态而异。也就是说单价没涨,但只看"每百万token多少钱"可能会低估真实账单。此外,Anthropic已在6月26日把限流统一成Start、Build、Scale三档,Sonnet与Haiku的限流额度首次对齐到Opus同一档位。
OpenAI:GPT-5.6拆成三档,缓存计费多了一个中间层
Sol、Terra、Luna怎么分工
OpenAI在6月26日开放GPT-5.6家族限量预览,7月9日正式开放调用,一次给出三个档位:面向最复杂任务的Sol、承担日常均衡工作的Terra,以及面向高并发低成本场景的Luna。三者都支持约105万token上下文和12.8万最大输出,标准价格分别为每百万token输入/输出5美元/30美元(Sol)、2.5美元/15美元(Terra)、1美元/6美元(Luna)。这套三档结构和此前单一旗舰模型的打法不同,更像是把"选模型"直接变成"选预算":不同任务不再默认挂在同一个模型上跑。
缓存计费出现新的中间档位
GPT-5.6的prompt caching定价拆成了三层:标准输入价、缓存写入价、缓存命中价。以Sol为例,标准输入是每百万token 5美元,缓存命中(读)价格约0.5美元,新出现的缓存写入价格约1.25美元;Terra、Luna两档也是相同比例结构。也就是说,缓存不再是"全价或命中折扣价"的两档模型,写入这一步本身也单独计价,开发者在评估要不要对某段上下文开启缓存时,需要把写入成本也算进去,而不能只看命中后的折扣幅度。与此同时,微软已经把GPT-5.6设为Microsoft 365 Copilot(Word、Excel、PowerPoint、Chat等)的默认模型,这也是目前少数已经公开落地到大型办公软件里的最新一代模型。
Google:Gemini 3.6 Flash提效,3.5 Pro还没到
3.6 Flash和3.5 Flash-Lite的分工
7月21日,Google DeepMind发布Gemini 3.6 Flash与Gemini 3.5 Flash-Lite。3.6 Flash定价为每百万token输入1.5美元、输出7.5美元,官方给出的对比数据是:完成同等质量任务,输出token数比上一代3.5 Flash减少约17%,知识截止时间也从2025年1月推进到2026年3月。3.5 Flash-Lite价格降到输入0.3美元、输出2.5美元,定位更明确地指向高吞吐、低延迟场景,例如批量文档处理和agentic搜索这类单次质量要求不高、但调用量极大的任务。
旗舰档"缺席"背后,是Gemini 4已经开始预训练
这次更新里没有出现理应对标GPT-5.6 Sol、Claude Opus 5的"Gemini 3.5 Pro"。Google DeepMind的说法是3.5 Pro仍在与合作伙伴测试,还没有公开发布时间;同时官方确认下一代Gemini 4已经启动"最雄心勃勃的一次预训练",但仍处于早期阶段。对开发者来说,这意味着短期内如果需要Gemini阵营里对标另外两家旗舰档的模型,能用的选择实际上还是空的,只能先在3.6 Flash和更早的Pro版本之间做取舍。
放在一起看:三家这次更新到底改变了什么
把三家的动作放进同一张表看,共性比差异更值得记住:上下文窗口都在向100万token量级靠拢,缓存折扣普遍维持在九成上下,但具体计价细节——分词器效率、缓存写入是否单独收费、限流分层怎么分——每家都不一样,不能只比"每百万token多少钱"这一个数字。
横向对比:价格、上下文、缓存折扣
| 模型 | 输入价格(每百万token) | 输出价格(每百万token) | 上下文窗口 | 缓存读价格 |
|---|---|---|---|---|
| Claude Opus 5 | $5 | $25 | 100万token(默认即上限) | 约为标准输入价的10% |
| GPT-5.6 Sol | $5 | $30 | 约105万token | 约为标准输入价的10%(另有约25%的缓存写入价) |
| Gemini 3.6 Flash | $1.5 | $7.5 | 官方未披露具体数值 | 约为标准输入价的10% |
开发者接下来要做的三件事
- 不要只比价格数字:分词器不同,同样的文本切出的token数量不同,实际账单会不同。
- 把缓存策略和真实调用模式对上:短生命周期、低复用率的上下文,按新的缓存写入计价重新算一遍是否划算。
- 给限流层级留余量:三家都在扩容或重分限流分层,真正压测之前不要假设新档位一定能扛住峰值调用。
总结:选哪家模型之前,先想清楚怎么稳定调用
读完这些变化,开发者接下来大概率会关心的不是"这三家谁更便宜",而是"业务要不要跟着换模型、换了之后线上稳定性怎么保证"——毕竟每家都在调整限流分层和计费细节,单一上游一旦触发限流或短暂不可用,业务就会跟着卡住。这也是PioModel这类聚合网关存在的现实价值:开发者用一个API Key统一调用Claude、GPT、Gemini、DeepSeek等多家模型,由网关做多线路智能路由和自动切换,单一上游的限流或超时不必再由业务代码自己兜底。

评论
登录后可参与评论