发生了什么
Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5。核心定位一句话:接近 Fable 5 的前沿智能,但价格只有一半。Opus 5 已成为 Claude Max 的默认模型,也是 Claude Pro 上的最强模型。
定价与 Opus 4.8 持平:
| 项目 | Opus 5 | Opus 4.8 |
|---|---|---|
| 输入 | $5 / 百万 token | $5 / 百万 token |
| 输出 | $25 / 百万 token | $25 / 百万 token |
| Fast 模式 | 基础价 ×2,速度约 2.5× | 同左 |
Opus 5 没有数据留存要求(data retention),可通用访问。
评估结果:编码和知识工作全面领先
Opus 5 在多个公开基准上达到同价位最优:
| 基准 | 结果 |
|---|---|
| Frontier-Bench v0.1 | 超越所有其他模型,每任务成本低于 Opus 4.8,性能翻倍以上 |
| CursorBench 3.2(max effort) | 距 Fable 5 峰值仅 0.5%,但每任务成本减半 |
| ARC-AGI 3 | 分数是次优模型的 3 倍 |
| Zapier AutomationBench | 通过率约为次优模型的 1.5×;最低 effort 仍超过其他模型 |
| OSWorld 2.0(计算机操作) | 任意成本下均最优,超过 Fable 5 最佳结果但成本仅 1/3 |
| GDPval-AA v2(知识工作) | 新 SOTA |
Anthropic 强调 Opus 5 的核心差异不是原始分数,而是在相同成本下更高效——通过 effort 设置在智能和成本之间调节。
Agent 能力:自行验证、自行纠错
Anthropic 在公告中给出了几个 Opus 5 展现"主动性和彻底性"的真实案例:
- 手绘零件 → 3D 重建:在 Frontier-Bench 中,Opus 5 被给一张机器零件图纸要求生成 FreeCAD 模型,但被故意禁止直接查看图纸。Opus 5 自己写了计算机视觉 pipeline 从原始像素提取几何,然后重建出完整零件,多次成功;其他模型在同一设置下尝试 5 次均失败。
- 根因分析:针对一个开源包管理器的真实 bug,Opus 5 找到根因并修复了社区补丁遗漏的边界情况;竞品模型只修了表面症状就报告完成。
- 自建测试:一位交易公司工程师让 Opus 5 为新交易所构建市场数据 feed,之前的模型即使拿到详细计划也无法完成。Opus 5 在找不到 live feed 验证时,自己写了测试 harness 确认代码正确解析了交易所数据。
对齐与安全:当前最对齐的模型
Anthropic 的自动行为审计(automated behavioral audit)显示 Opus 5 是迄今最对齐的模型:
- 总体行为不一致得分 2.3(越低越好),优于 Opus 4.8、Sonnet 5 和 Fable 5
- 欺骗行为率最低
- 最难被诱导误用
- 在可能造成不可逆后果的操作上最谨慎
网络安全方面的关键设计:Opus 5 未在 cyber 任务上训练,但因通用能力提升,在发现漏洞方面接近 Mythos 5。但在利用漏洞(把漏洞变成实际威胁)方面仍大幅落后于 Mythos 5。
安全分类器行为:
| 模型 | 分类器干预频率 |
|---|---|
| Fable 5 | 基准 |
| Opus 5 | 比 Fable 5 少约 85% |
Opus 5 允许在源码中查找漏洞,但阻止二进制扫描、渗透测试和 exploit 生成。被标记的请求默认回退到 Opus 4.8。企业可通过 Cyber Verification Program(CVP)获取限制更少的版本。
同步发布的两个 API 能力(Beta)
- Mid-conversation tool changes:对话中途可更改工具集,不破坏 prompt cache。
- Automatic fallbacks:Opus 5 或 Fable 5 被 safety classifier 拦截时自动路由到其他模型,而不是直接阻断请求。
对读者的判断与行动建议
| 你的情况 | 行动建议 |
|---|---|
| Claude Max / Pro 用户 | Opus 5 已是默认模型,无需操作。日常编码和知识工作直接用,省着用 Fable 5 配额 |
| API 开发者 | 模型 ID claude-opus-5,定价和 4.8 一致但能力显著更强,建议直接迁移;用 effort 参数平衡成本 |
| 做 Agent harness | Opus 5 的自行验证和纠错能力意味着可以信任更长任务链,但仍需监控 token 消耗——max effort 很贵 |
| 关注安全 | Opus 5 是当前最对齐模型,分类器干预比 Fable 5 少 85%。但"发现漏洞接近 Mythos、利用漏洞远落后"这个设计值得记住 |
| 在 Fable 5 和 Opus 5 间选 | 需要前沿极限能力(如网络安全、复杂推理)选 Fable 5;日常高性价比编码和知识工作选 Opus 5 |
一句话结论:Opus 5 让"Fable 级智能"进入日常可用价位。对大多数开发者,它是比 Fable 5 更合理的默认选择——除非你的任务正好落在 Opus 5 的安全限制范围内。
