一、Sonnet 5 发布:Anthropic 深夜连放两弹
2026年6月30日深夜,Anthropic 一次性放出两个重磅更新:Claude Sonnet 5 和全新的 Claude Science AI 科研工作台。Sonnet 5 直接被设为 Claude 平台默认模型,向免费及付费用户全面开放。
这次发布很有意思——旗舰模型 Opus 4.8 才刚发布没多久,Anthropic 就把中端产品线升级了,而且升级幅度相当大。官方的说法是:"Sonnet 5 是迄今智能体能力最强的 Sonnet 模型,在大量智能体任务中的表现接近旗舰模型 Opus 4.8。"
结合最近行业趋势来看,这其实传递了一个明确信号:大模型竞争的主战场正在从"跑分"转向"落地"。企业真正关心的不是模型在排行榜上多几分,而是能不能把 Agent 任务跑通、能不能真正帮人干活。Sonnet 5 瞄准的就是这个痛点。
💡 快速了解:Sonnet 是 Anthropic 的中端产品线,定位在入门级 Haiku 和旗舰级 Opus 之间。它的目标是用更低的价格提供接近旗舰的体验,是企业部署最常用的一档。
Sonnet 5 核心亮点速览
- Agent 能力大幅提升:网页浏览、代码生成、多步骤规划等复杂任务完成度显著提高
- 接近 Opus 4.8 的表现:在 BrowseComp 和 OSWorld-Verified 两项 Agent 测试中表现逼近旗舰
- 价格更有竞争力:优惠期输入 $2/百万、输出 $10/百万,比 Opus 便宜约 60%
- 全新分词器:处理文本方式变化,同样内容可能被切分成更多 token
- 默认模型:已取代 Sonnet 4.6 成为 Claude 平台和 API 的默认选择
二、核心性能对比:Sonnet 5 vs Opus 4.8 vs Sonnet 4.6
先看一张全面的参数对比表,了解 Sonnet 5 在产品线里的位置:
| 对比项 | Opus 4.8(旗舰) | Sonnet 5(中端新) | Sonnet 4.6(旧) |
|---|---|---|---|
| 定位 | 顶级旗舰 | 主力中端 | 旧款中端 |
| Agent 能力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐½ | ⭐⭐⭐ |
| 代码生成 | 最强 | 接近旗舰 | 良好 |
| 推理速度 | 慢 | 快 | 中等 |
| 上下文窗口 | 200K | 200K | 200K |
| 输入价格(优惠) | $5/百万 | $2/百万 | $3/百万 |
| 输出价格(优惠) | $25/百万 | $10/百万 | $15/百万 |
| 适合场景 | 高难度推理、科研 | 企业 Agent、代码、日常 | 普通对话、写作 |
从定位来看,Sonnet 5 很像是"小 Opus"——用 Opus 4.8 约 40% 的价格,提供 85%-90% 的体验。对于绝大多数企业场景来说,这个性价比是很有吸引力的。
⚠️ 注意价格时效:输入 $2、输出 $10 的优惠价格只持续到 2026年8月31日。之后恢复到输入 $3/百万、输出 $15/百万的标准价,届时比 Opus 4.8 便宜约 40%。
三、Agent 能力实测:智能体任务完成度提升多少?
Sonnet 5 最核心的升级就是 Agent 能力。Anthropic 用两个专业测试来衡量:BrowseComp(网页浏览搜索类 Agent 任务)和 OSWorld-Verified(电脑操作类 Agent 任务)。
测试结果解读
在不同的算力投入水平下,Sonnet 5 相比 Sonnet 4.6 都有稳定提升。Opus 4.8 依然是这两项测试里精度最高的选择,但 Sonnet 5 用更低的价格提供了相当不错的水准。
更重要的是来自早期合作伙伴的反馈:
1复杂任务能"跑到底"
之前 Sonnet 模型遇到多步骤任务容易"半途而废"——做着做着就偏题或者停了。Sonnet 5 明显能把复杂任务完整跑完,不会半路掉链子。
2主动检查输出
很多用户反馈,Sonnet 5 经常会在没有特别要求的情况下,自己检查输出结果、修正错误。这种"自检能力"是 Agent 可靠性的关键。
3工具调用更精准
调用外部工具(搜索、代码执行、文件操作等)的准确率提升明显,不会出现"该调工具的时候不调、不该调的时候乱调"的情况。
对普通用户意味着什么?
如果你用 Claude 做的是简单对话、写文案、翻译这类任务,Sonnet 5 相比 4.6 的提升感知可能不太大。但如果你经常让它做多步骤任务——比如"帮我分析这份财报,提取关键数据并生成图表"、"帮我写一个完整的网页并调试"——体验差距会很明显。
简单说:任务越复杂、步骤越多,Sonnet 5 的优势越大。
四、API 价格表详解:比 Opus 便宜 60% 是怎么算的?
大家最关心的价格问题,我们来算清楚。
Claude 全系列 API 价格对比
| 模型 | 输入价格 (每百万 token) |
输出价格 (每百万 token) |
相对 Opus 的成本 |
|---|---|---|---|
| Opus 4.8 | $5 | $25 | 100%(基准) |
| Sonnet 5(优惠期) | $2 | $10 | 约 40% |
| Sonnet 5(标准价) | $3 | $15 | 约 60% |
| Sonnet 4.6 | $3 | $15 | 约 60% |
| Haiku | $0.25 | $1.25 | 约 5% |
这里有个细节值得注意:Sonnet 5 的优惠期价格甚至比旧款 Sonnet 4.6 还便宜($2/$10 vs $3/$15)。相当于"加量还减价",Anthropic 这波是真的卷。
和国产模型比贵不贵?
很多人会拿 DeepSeek、通义千问这些国产模型来比价格。说实话,纯比单价肯定比不过——国产模型的输出价格能低到每百万 token 几块钱人民币,Sonnet 5 输出要 10 美元,差了一个数量级。
但这里有几个维度要考虑:
- 任务完成率:复杂任务上 Sonnet 5 可能一次就做对,便宜的模型可能要反复调,算上时间成本未必更划算
- 英文和代码能力:英文任务、复杂编程、跨语言项目,Claude 家族的优势还是很明显
- 企业合规和安全:海外企业、出海项目,Claude 的数据安全和合规资质更齐全
所以选型不是看单价,而是看"完成这件事的总成本"。
五、新分词器影响:同样内容 token 数变多了?
Sonnet 5 用了新的分词器(tokenizer),这是个容易被忽略但影响实际成本的变化。
什么是分词器?
大模型不是一个字一个字处理文本的,而是先把文本切成一个个"token"——可以理解为语言的最小单位。英文大概是 0.75 个单词 = 1 个 token,中文大概是 1-2 个汉字 = 1 个 token。分词器不一样,切出来的 token 数量和方式就不一样。
变化有多大?
Anthropic 官方的说法是:同样的输入内容,Sonnet 5 可能被切分成更多 token,大致是原来的 1 到 1.35 倍,具体取决于内容类型。
💡 举个例子:假设你有一段文本,Sonnet 4.6 会切成 1000 个 token,Sonnet 5 可能切成 1100-1350 个。虽然单价降了,但 token 数变多了,实际成本变化要算一下。
实际成本是涨了还是降了?
我们来算一笔账:假设 Sonnet 4.6 处理一段内容需要 1000 个输出 token,成本是 $15/百万 × 1000 = $0.015。
换成 Sonnet 5(优惠期):同样内容变成 1350 个 token,成本是 $10/百万 × 1350 = $0.0135。
结论:即使按最坏情况(token 增加 35%)算,优惠期的 Sonnet 5 还是比 4.6 便宜约 10%。如果是代码等 token 增加较少的内容,便宜得更多。
Anthropic 也说了,优惠价格的设定已经把新分词器的因素考虑进去了,整体迁移成本基本持平甚至略低。
六、Claude Science:面向科学家的 AI 工作台
和 Sonnet 5 一起发布的还有 Claude Science——一款面向科研人员的 AI 工作台。这东西挺值得聊,因为它代表了 Anthropic 在垂直领域的布局思路。
Claude Science 是什么?
它不是一个新模型,而是基于现有 Claude 模型构建的工作流产品。核心是一个"协调代理"(Coordinator Agent),可以调用超过 60 个预置技能和连接器,覆盖基因组学、蛋白质组学、结构生物学、化学信息学等科研领域。
有意思的是,这个协调代理还能生成其他代理——相当于你告诉它要做什么研究,它自己组建一个 AI 团队来干活。
最大亮点:独立的"审核代理"
科研最怕什么?AI 瞎编数据、捏造引用。Claude Science 专门设计了独立的审核代理(Review Agent),负责实时检查引文和计算结果,标记并纠正错误。
这个思路很务实——不是说"我的模型不会出错",而是承认模型会出错,然后用另一个模型来检查和纠错。双模型互相校验,总比单模型靠谱。
对科研工作者的价值
- 文献综述:快速梳理某个领域的研究进展,附带来源链接可追溯
- 数据分析:调用专业工具处理实验数据,生成图表和统计报告
- 实验设计:基于已有研究,帮助设计实验方案和对照组
- 论文写作:辅助撰写论文初稿,确保引用准确
目前 Claude Science 还是 Beta 阶段,主要面向科研机构和企业研发部门开放。普通用户暂时用不上,但这个方向很值得关注——垂直领域的 Agent 工作台可能是 AI 下一个爆发点。
七、开发者迁移指南:从 Sonnet 4.6 升级到 5
如果你正在用 Claude API,迁移到 Sonnet 5 需要注意什么?
基本升级
模型代号是 claude-sonnet-5,把 API 调用里的模型名换掉就行:
# 旧版本
model="claude-sonnet-4-6-20240820"
# 新版本
model="claude-sonnet-5-20260630"
💡 提示:如果你用的是 claude-sonnet-latest 别名,那已经自动升级到 Sonnet 5 了,什么都不用改。
需要注意的变化
1Token 计数变化
新分词器导致同样的内容 token 数变多。如果你代码里有基于 token 数量的逻辑(比如分段、计费、截断),需要重新测试和调整。建议用官方的 token 计数器重新估算。
2输出格式可能微调
虽然 Anthropic 尽量保持了一致性,但模型升级后输出风格、格式可能会有细微变化。如果你有严格的格式解析(比如 JSON 输出、结构化数据提取),建议跑一遍测试用例。
3Agent 行为变化
好的方面是 Agent 能力变强了,但这也意味着它可能会做一些之前不会做的事——比如更主动地调用工具、更深入地探索。如果你有严格的安全边界,可能需要重新确认系统提示词是否够约束。
迁移建议
- 先在测试环境跑一遍:把典型用例都过一遍,确认输出质量和格式
- 监控成本变化:上线后观察前几天的 token 消耗,和之前对比
- 逐步放量:先切 10% 流量,没问题再全量升级
- 利用优惠期:8月31日之前是优惠价,适合充分测试和成本估算
八、总结:值不值得换?
最后给一个明确的结论和选型建议。
✅ 推荐升级的情况:
- 你在做 AI Agent / 智能体相关的应用
- 经常需要多步骤、复杂任务的自动化
- 用 Opus 觉得太贵,用 Sonnet 4.6 觉得不够强
- 代码生成、数据分析是主要场景
⚠️ 可以再等等的情况:
- 只是简单的对话、写作、翻译场景
- 对成本极其敏感,现有模型已经够用
- 系统里有大量依赖 token 计数的复杂逻辑,迁移成本高
我的看法
Sonnet 5 是 Anthropic 在 2026 年下半年打出的一张关键牌。它的策略很清晰:用旗舰级的 Agent 能力 + 中端的价格,抢占企业级智能体市场。毕竟 Opus 虽强,但 $25/百万输出 token 的价格不是谁都用得起的。
往大了看,这也反映了整个行业的趋势:大模型的竞争正在从"参数竞赛"转向"性价比竞赛"和"落地能力竞赛"。谁能用更低的成本把真正有用的事做成,谁才能活到最后。
对于个人开发者和中小企业来说,Sonnet 5 提供了一个很好的选择:花中端的钱,享受接近旗舰的体验。尤其是在优惠期(到8月底),性价比确实很高,值得尝试。
如果你已经在使用 Claude API,建议尽快在测试环境升级试一下。大部分情况下,体验会有提升,成本基本持平甚至下降。