动态:一手资料追踪

Claude Opus 5:接近 Fable 5 智能、价格减半,Anthropic 当前对齐最好的模型

更新 摘译
标签
claudellm-releasecoding-agentsevaluation
腾讯云新用户专属折扣

发生了什么

Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5。核心定位一句话:接近 Fable 5 的前沿智能,但价格只有一半。Opus 5 已成为 Claude Max 的默认模型,也是 Claude Pro 上的最强模型。

定价与 Opus 4.8 持平:

项目 Opus 5 Opus 4.8
输入 $5 / 百万 token $5 / 百万 token
输出 $25 / 百万 token $25 / 百万 token
Fast 模式 基础价 ×2,速度约 2.5× 同左

Opus 5 没有数据留存要求(data retention),可通用访问。


评估结果:编码和知识工作全面领先

Opus 5 在多个公开基准上达到同价位最优:

基准 结果
Frontier-Bench v0.1 超越所有其他模型,每任务成本低于 Opus 4.8,性能翻倍以上
CursorBench 3.2(max effort) 距 Fable 5 峰值仅 0.5%,但每任务成本减半
ARC-AGI 3 分数是次优模型的 3 倍
Zapier AutomationBench 通过率约为次优模型的 1.5×;最低 effort 仍超过其他模型
OSWorld 2.0(计算机操作) 任意成本下均最优,超过 Fable 5 最佳结果但成本仅 1/3
GDPval-AA v2(知识工作) 新 SOTA

Anthropic 强调 Opus 5 的核心差异不是原始分数,而是在相同成本下更高效——通过 effort 设置在智能和成本之间调节。


Agent 能力:自行验证、自行纠错

Anthropic 在公告中给出了几个 Opus 5 展现"主动性和彻底性"的真实案例:

  • 手绘零件 → 3D 重建:在 Frontier-Bench 中,Opus 5 被给一张机器零件图纸要求生成 FreeCAD 模型,但被故意禁止直接查看图纸。Opus 5 自己写了计算机视觉 pipeline 从原始像素提取几何,然后重建出完整零件,多次成功;其他模型在同一设置下尝试 5 次均失败。
  • 根因分析:针对一个开源包管理器的真实 bug,Opus 5 找到根因并修复了社区补丁遗漏的边界情况;竞品模型只修了表面症状就报告完成。
  • 自建测试:一位交易公司工程师让 Opus 5 为新交易所构建市场数据 feed,之前的模型即使拿到详细计划也无法完成。Opus 5 在找不到 live feed 验证时,自己写了测试 harness 确认代码正确解析了交易所数据。

对齐与安全:当前最对齐的模型

Anthropic 的自动行为审计(automated behavioral audit)显示 Opus 5 是迄今最对齐的模型:

  • 总体行为不一致得分 2.3(越低越好),优于 Opus 4.8、Sonnet 5 和 Fable 5
  • 欺骗行为率最低
  • 最难被诱导误用
  • 在可能造成不可逆后果的操作上最谨慎

网络安全方面的关键设计:Opus 5 未在 cyber 任务上训练,但因通用能力提升,在发现漏洞方面接近 Mythos 5。但在利用漏洞(把漏洞变成实际威胁)方面仍大幅落后于 Mythos 5。

安全分类器行为:

模型 分类器干预频率
Fable 5 基准
Opus 5 比 Fable 5 少约 85%

Opus 5 允许在源码中查找漏洞,但阻止二进制扫描、渗透测试和 exploit 生成。被标记的请求默认回退到 Opus 4.8。企业可通过 Cyber Verification Program(CVP)获取限制更少的版本。


同步发布的两个 API 能力(Beta)

  1. Mid-conversation tool changes:对话中途可更改工具集,不破坏 prompt cache。
  2. Automatic fallbacks:Opus 5 或 Fable 5 被 safety classifier 拦截时自动路由到其他模型,而不是直接阻断请求。

对读者的判断与行动建议

你的情况 行动建议
Claude Max / Pro 用户 Opus 5 已是默认模型,无需操作。日常编码和知识工作直接用,省着用 Fable 5 配额
API 开发者 模型 ID claude-opus-5,定价和 4.8 一致但能力显著更强,建议直接迁移;用 effort 参数平衡成本
做 Agent harness Opus 5 的自行验证和纠错能力意味着可以信任更长任务链,但仍需监控 token 消耗——max effort 很贵
关注安全 Opus 5 是当前最对齐模型,分类器干预比 Fable 5 少 85%。但"发现漏洞接近 Mythos、利用漏洞远落后"这个设计值得记住
在 Fable 5 和 Opus 5 间选 需要前沿极限能力(如网络安全、复杂推理)选 Fable 5;日常高性价比编码和知识工作选 Opus 5

一句话结论:Opus 5 让"Fable 级智能"进入日常可用价位。对大多数开发者,它是比 Fable 5 更合理的默认选择——除非你的任务正好落在 Opus 5 的安全限制范围内。