Claude Sonnet 5 实测:能力媲美 Opus 4.8,高性价比编程新选择
Anthropic 全新模型 Sonnet 5 已经悄然而至,如果你还在抱怨 Opus 4.8 近期的“降智”表现,那现在答案很清晰了——资源正在向这颗新星倾斜。快速翻看官方博客,可以用一句话概括:Sonnet 5 主打“物美价廉”,是日常工作和编程场景中极具性价比的模型。

物美:全方位性能跨越
对于习惯使用 Sonnet 4.6 的用户来说,这次更新带来的提升几乎是质变。

Sonnet 5 在推理、工具调用、编码和知识工作等领域比前代 Sonnet 4.6 拥有显著增强,各项基准指标全面跃进,综合表现已十分贴近 Opus 4.8。这意味着 Sonnet 5 是一款全能型的工作模型,尤其是在智能体编程能力上实现了巨大跃升。知识工作方面的进步同样惊人,甚至在部分场景中超越了 Opus 4.8。
除了漂亮的跑分,它依然延续了标准的 100 万 token 上下文窗口。思考模式也从原先的“扩展思考”升级为自适应机制:
Adaptive thinking replaces extended thinking. It’s on by default in Claude Code and the API. Start at medium effort, and bump to high for long agentic runs or memory-heavy work. Most coding and tool use won’t need more than that.
这些调整都是为了应对更加复杂的长任务而设计。根据官方的内部测试,Sonnet 5 和 Sonnet 4.6 之间已经不再是程度上的差异,而是“能”与“不能”的鸿沟。
许多过去 Sonnet 4.6 直接放弃的任务,现在 Sonnet 5 可以流畅完成。
价廉:国外顶级模型中的性价比之王
性能的提升如果配上一个高价标签,就多少会令人犹豫。但 Sonnet 5 偏偏在定价上给出了诚意。当然,和国内模型相比谈不上便宜,但在同类海外模型中确实相当克制。
| 模型 | 输入 | 缓存输入 | 输出 | 备注 |
|---|---|---|---|---|
| Claude Sonnet 5 | $2 | $0.20 | $10 | 2026 年 8 月 31 日前优惠价 |
| Claude Sonnet 5 | $3 | $0.30 | $15 | 2026 年 9 月 1 日起 |
| Claude Opus 4.8 | $5 | $0.50 | $25 | Anthropic 高端旗舰档 |
| GPT-5.5 | $5 | $0.50 | $30 | 短上下文价格 |
| GPT-5.5 长上下文 | $10 | $1.00 | $45 | OpenAI 单独长上下文档 |
| Gemini 3.1 Pro Preview ≤200k | $2 | $0.20 | $12 | 标准档 |
| Gemini 3.1 Pro Preview >200k | $4 | $0.40 | $18 | 超过 200k 输入后涨价 |
从表格中可以清楚看到,Opus 4.8 的输入价格为 $5、输出 $25,而 Sonnet 5 标准价格为 $3 和 $15,特惠期更是低至 $2 和 $10。在海外顶级模型中,这个定价堪称最低门槛。拥有逼近 Opus 4.8 的能力,同时享受近乎六折的定价,性价比立刻凸显。
人人可用:全平台即时触达
相比 Fable 5 上线后反复横跳、频繁要求认证的折腾,Sonnet 5 的开放策略友好得多。

模型直接面向全平台推送,手机、电脑、网页端即刻可用。无论是 Pro 用户还是免费用户,都能立即体验。当然,前提是你的账号保持存活状态。
实测:“天文机械表”极限挑战
为了验证真实能力,这里选用了一个最新且难度极高的综合测试题——“天文机械表”。这道题在过去一段时间让众多国产模型全军覆没,之前仅有 Opus 4.8 几乎拿下满分。
完整题目如下:
用单个 HTML 文件实现一只机械腕表风格的天文时钟,纯原生实现,不许使用任何库、框架或 CDN。要求:
1. 主表盘读取本地系统时间,秒针平滑扫秒,使用 requestAnimationFrame 驱动,且长时间运行不得累积漂移;切到其他标签页再切回来时,指针必须立即校准到正确时间。
2. 包含一个月相小表盘,根据当前日期计算并显示月相连续变化,公式需要自行实现,精度要求误差控制在 1 天内。
3. 包含一个可用的计时码表,通过子表盘指针显示,支持开始、暂停、继续、归零与计圈(lap),按钮在任意顺序点击都不能出现状态错误。
4. 日期窗显示当前日期,正确处理大小月与闰年。
5. 包含昼夜 / 日出日落指示,用户可在三到四个预设城市之间切换,并根据经纬度现场计算当地日出日落时刻。
6. 页面需要响应式,并尊重 prefers-reduced-motion:开启时秒针改为跳秒并关闭装饰动画;同时为各表盘补充 ARIA 标注。
7. 整体视觉要像一只真实的高级腕表,而不是普通练习作业。
只输出最终代码,不要解释。
测试说明:
这是一个面向前沿模型的**长规格前端综合题**。与普通模拟时钟不同,它故意把数学推导、动画工程、状态机正确性、无障碍适配与高级审美堆叠在同一题中,观察模型是否会在实现过程中静默漏需求。
题目的核心目标不是“做一个能转的表盘”,而是要求模型在**闭卷推导**与**高约束实现**之间保持稳定。月相算法、日出日落计算、后台切回后的时间校准,以及计时码表的开始 / 暂停 / 继续 / 归零 / 计圈边界行为,都是高频失分点。
工程要求:主表盘必须使用 **requestAnimationFrame** 驱动平滑扫秒,不能依赖会累积漂移的定时器;切换后台标签页后,返回前台时指针必须立即与系统时间重新对齐。
设计要求:页面必须保持单文件、纯原生、响应式,同时尊重 **prefers-reduced-motion**,为关键表盘与控件补齐 ARIA 标注,并在整体视觉上呈现出真实机械天文腕表的精致感,而不是普通练习作业。
测试直接在 Claude 桌面版的 Chat 功能中进行:

思考强度设置为中等(Medium):

在其上方还有 High、Extra、Max 三个更高档位可供选择。
最终测试结果出炉:

结果几乎又是全对。时钟显示准确,地区切换与日出日落联动正常,计时码表的启动、暂停、复位、计圈全部无差错,月相呈现也符合预期。

此刻正值农历十七,月相几乎满月点亮状态,计算与视觉效果都十分吻合。Anthropic 所言非虚,Sonnet 5 在这道难题上的表现与 Opus 4.8 几乎完全一致,而本次仅仅使用了中档思考强度。当时测试 Opus 4.8 使用的是高档,而现在最新的 Sonnet 5 仅中档就已足够。除了 Anthropic 自家的模型,目前几乎没有任何外部模型能完整通过这项挑战。
所有详细的测试结果都已经整理在 Jarvis Uni 的 TOPAI 板块中,可供直观对比。
更多后续测试,很快会持续更新。
Sonnet 5 的思维能力强到足以驾驭这类复杂编程任务,日常办公自然更不在话下。再结合 Claude 的 Cowork 协作功能,无疑是效率利器。

如今各类 Work 工具层出不穷,但归根结底,核心还是底层模型能力与 Harness 的调教水平。在这两方面,Claude Cowork 绝对称得上是行业先驱。
总结而言,Sonnet 5 已经蜕变为能够比肩 Opus 4.8 的存在,成为 Claude 系列中最具性价比、最适合日常工作的模型,同时也完全胜任高强度的编程任务。真正的智能并不在于见过多少题,而在于面对从未见过的复杂问题,依然能够稳定解出。在这一点上,Claude 系列展现出了真正接近思考本质的能力。