Home

/

News

/

Claude Opus 5、GPT-5.6、Gemini 3.6 Flash密集发布:大模型API定价与能力年中解读

Claude Opus 5、GPT-5.6、Gemini 3.6 Flash密集发布:大模型API定价与能力年中解读

Claude Opus 5、GPT-5.6、Gemini 3.6 Flash密集发布:大模型API定价与能力年中解读

P

PioModel Editorial

·

7/29/2026

·

8 min read

TL;DR

一个月内,Anthropic、OpenAI、Google相继更新模型API:Opus 5维持原价、Sonnet 5换分词器、GPT-5.6拆三档、Gemini 3.6 Flash提效。本文梳理三家最新定价与能力变化。

三大厂商在同一个月密集调整API:这轮大模型API定价更新说明了什么

2026年6月下旬到7月下旬的一个月时间里,Anthropic、OpenAI、Google DeepMind先后完成了各自模型阵容的更新,大模型API定价与能力边界几乎同步发生变化:Claude Sonnet 5、Claude Opus 5、GPT-5.6家族、Gemini 3.6 Flash相继上线,上下文窗口、分词方式、限流分层、缓存计费规则都有实质调整。对正在用API构建产品的开发者来说,这不是一次孤立的模型更新,而是三条产品线同时重新校准了"每次调用到底值多少钱、能装多少上下文"这个问题的答案。

2026年6-7月大模型API密集更新时间线
2026年6-7月大模型API密集更新时间线

Anthropic:Opus 5价格没变,Sonnet 5换了计价规则

Opus 5用同样的价格换来更大的默认上下文

7月24日,Anthropic发布Claude Opus 5,官方称其为相对Claude Opus 4.8的"step-change"式提升。变化直接体现在两点:一是100万token上下文这次默认就是上限,不需要再单独开启;二是最大输出提高到12.8万token,并且默认开启thinking(推理)模式。价格维持在每百万token输入5美元、输出25美元,与Opus 4.8完全相同——对已经在用Opus系列的团队而言,换模型不需要重新做成本预算,但输出内容默认带推理过程,实际消耗的token量未必和过去一样。

Sonnet 5引入新分词器,同样字数会切出更多token

6月30日上线的Claude Sonnet 5同样支持100万token上下文、12.8万最大输出,采用引入期价格(每百万token输入2美元、输出10美元,截至8月31日),此后回到标准的3美元/15美元。开发者需要留意的细节是:Sonnet 5启用了新分词器,官方说明同一段文本切出的token数量会比旧模型多出约三成,具体幅度因内容和任务形态而异。也就是说单价没涨,但只看"每百万token多少钱"可能会低估真实账单。此外,Anthropic已在6月26日把限流统一成Start、Build、Scale三档,Sonnet与Haiku的限流额度首次对齐到Opus同一档位。

OpenAI:GPT-5.6拆成三档,缓存计费多了一个中间层

Sol、Terra、Luna怎么分工

OpenAI在6月26日开放GPT-5.6家族限量预览,7月9日正式开放调用,一次给出三个档位:面向最复杂任务的Sol、承担日常均衡工作的Terra,以及面向高并发低成本场景的Luna。三者都支持约105万token上下文和12.8万最大输出,标准价格分别为每百万token输入/输出5美元/30美元(Sol)、2.5美元/15美元(Terra)、1美元/6美元(Luna)。这套三档结构和此前单一旗舰模型的打法不同,更像是把"选模型"直接变成"选预算":不同任务不再默认挂在同一个模型上跑。

缓存计费出现新的中间档位

GPT-5.6的prompt caching定价拆成了三层:标准输入价、缓存写入价、缓存命中价。以Sol为例,标准输入是每百万token 5美元,缓存命中(读)价格约0.5美元,新出现的缓存写入价格约1.25美元;Terra、Luna两档也是相同比例结构。也就是说,缓存不再是"全价或命中折扣价"的两档模型,写入这一步本身也单独计价,开发者在评估要不要对某段上下文开启缓存时,需要把写入成本也算进去,而不能只看命中后的折扣幅度。与此同时,微软已经把GPT-5.6设为Microsoft 365 Copilot(Word、Excel、PowerPoint、Chat等)的默认模型,这也是目前少数已经公开落地到大型办公软件里的最新一代模型。

Google:Gemini 3.6 Flash提效,3.5 Pro还没到

3.6 Flash和3.5 Flash-Lite的分工

7月21日,Google DeepMind发布Gemini 3.6 Flash与Gemini 3.5 Flash-Lite。3.6 Flash定价为每百万token输入1.5美元、输出7.5美元,官方给出的对比数据是:完成同等质量任务,输出token数比上一代3.5 Flash减少约17%,知识截止时间也从2025年1月推进到2026年3月。3.5 Flash-Lite价格降到输入0.3美元、输出2.5美元,定位更明确地指向高吞吐、低延迟场景,例如批量文档处理和agentic搜索这类单次质量要求不高、但调用量极大的任务。

旗舰档"缺席"背后,是Gemini 4已经开始预训练

这次更新里没有出现理应对标GPT-5.6 Sol、Claude Opus 5的"Gemini 3.5 Pro"。Google DeepMind的说法是3.5 Pro仍在与合作伙伴测试,还没有公开发布时间;同时官方确认下一代Gemini 4已经启动"最雄心勃勃的一次预训练",但仍处于早期阶段。对开发者来说,这意味着短期内如果需要Gemini阵营里对标另外两家旗舰档的模型,能用的选择实际上还是空的,只能先在3.6 Flash和更早的Pro版本之间做取舍。

放在一起看:三家这次更新到底改变了什么

把三家的动作放进同一张表看,共性比差异更值得记住:上下文窗口都在向100万token量级靠拢,缓存折扣普遍维持在九成上下,但具体计价细节——分词器效率、缓存写入是否单独收费、限流分层怎么分——每家都不一样,不能只比"每百万token多少钱"这一个数字。

横向对比:价格、上下文、缓存折扣

三家旗舰/轻量模型输入输出价格对比(每百万token,美元)
三家旗舰/轻量模型输入输出价格对比(每百万token,美元)
模型输入价格(每百万token)输出价格(每百万token)上下文窗口缓存读价格
Claude Opus 5$5$25100万token(默认即上限)约为标准输入价的10%
GPT-5.6 Sol$5$30约105万token约为标准输入价的10%(另有约25%的缓存写入价)
Gemini 3.6 Flash$1.5$7.5官方未披露具体数值约为标准输入价的10%

开发者接下来要做的三件事

  • 不要只比价格数字:分词器不同,同样的文本切出的token数量不同,实际账单会不同。
  • 把缓存策略和真实调用模式对上:短生命周期、低复用率的上下文,按新的缓存写入计价重新算一遍是否划算。
  • 给限流层级留余量:三家都在扩容或重分限流分层,真正压测之前不要假设新档位一定能扛住峰值调用。
本轮更新关键数字
本轮更新关键数字

总结:选哪家模型之前,先想清楚怎么稳定调用

读完这些变化,开发者接下来大概率会关心的不是"这三家谁更便宜",而是"业务要不要跟着换模型、换了之后线上稳定性怎么保证"——毕竟每家都在调整限流分层和计费细节,单一上游一旦触发限流或短暂不可用,业务就会跟着卡住。这也是PioModel这类聚合网关存在的现实价值:开发者用一个API Key统一调用Claude、GPT、Gemini、DeepSeek等多家模型,由网关做多线路智能路由和自动切换,单一上游的限流或超时不必再由业务代码自己兜底。

Get started with PioModel

One key for Claude, GPT, Gemini and more — pay as you go, no separate accounts needed.

Comments

Sign in to join the discussion