Claude Opus 5 在基准测试中以一半的价格超越《Fable 5》

BABA-1.64%
Key Takeaways
  • Anthropic 于 7 月 24 日发布了 Claude Opus 5,每百万输入token 为 5 美元/每百万输入token 价格为 5 美元,成本为 Fable 5 的一半。
  • Opus 5 在 Frontier-Bench v0.1 上取得 43.3%,高于 Fable 5 的 33.7% 以及 GPT-5.6 Sol 的 34.4%。
  • Opus 5 在 Claude Max 上成为默认版本,继 Fable 5 在其运营中断之后被替换。

Anthropic 于 7 月 24 日发布 Claude Opus 5,定价为每百万输入代币 $5——比其前代模型 Claude Fable 5 的成本低一半——同时在大多数主要基准测试上表现优于 Fable 5。Opus 5 在面向代理的编码评估 Frontier-Bench v0.1 上得分 43.3%,而 Fable 5 为 33.7%,OpenAI 的 GPT-5.6 Sol 为 34.4%;在新颖的问题求解基准 ARC-AGI-3 上,Opus 5 得分 30.2%,而 GPT-5.6 Sol 为 7.8%。新模型成为 Claude Max 的默认选项,并且在 Claude Pro 上是最强选项;实际上,在今年夏初 Fable 5 因运营中断而受到影响之后,Opus 5 取代大多数订阅用户的 Fable 5 成为首选。

Anthropic 的产品阵容分为四个层级:Haiku 速度快且便宜,Sonnet 处于中档,Opus 是重型主力;今年春天引入的 Mythos 级包括面向公众的 Claude Fable 5,以及通过 Project Glasswing 为经过审查的网络安全研究人员和关键基础设施运营商提供 Claude Mythos 5。

Claude Opus 5 在主要基准上全面超越 Fable 5

在 Frontier-Bench v0.1 上,该基准测试 AI 编码代理能否端到端完成真实的软件工程任务,Opus 5 达到 43.3%。Fable 5 为 33.7%,OpenAI 的 GPT-5.6 Sol 为 34.4%。

最大的差距出现在 ARC-AGI-3 上,这是一个围绕模型不可能仅凭训练数据记忆就能解决的新颖谜题而构建的问题求解测试。Opus 5 得分 30.2%;GPT-5.6 Sol 为 7.8%;Fable 5 完全未被测试。

在 GDPval-AA v2 上,这是通过 Elo 评分获得的知识工作基准,用于衡量在真实专业任务上的相对表现,Opus 5 达到 1,861,而 Fable 5 为 1,747,GPT-5.6 Sol 为 1,736。

根据 Anthropic 公布的基准测试结果,只有在法律和与健康相关的评估中,Fable 5 才以很小的优势优于 Opus 5。

Anthropic 将 Opus 5 定价为每百万输入代币 $5

Opus 5 可通过 API 获取:输入为每百万代币 $5,输出为每百万代币 $25。可用一个 Fast 模式,运行速度约为默认速度的 2.5 倍,价格是基础价格的两倍——输入为每百万代币 $10,输出为每百万代币 $50。

该定价与 Opus 4.8 相同,并且正好是 Fable 5 成本的一半;Anthropic 曾将 Fable 5 定位为面向付费用户的日常前沿产品。

Fable 5 因出口管制令被全球下架

Fable 5 于 6 月 9 日上线,之后仅三天就被全球下架;原因是美国政府发布紧急出口管制令,称其存在越狱漏洞,并于 6 月 30 日恢复上线。恢复后,它立即转为仅提供 credits 的模式,不再包含在标准方案中。

如今,Opus 5 填补了 Fable 5 无法守住的席位,即作为订阅旗舰。

第三方平台验证 Opus 5 的性能提升

Lovable 是一个拥有数百万用户的开发者平台,在其内部评估中运行了 Opus 5。“它不仅在我们最困难的代理式编码任务上更好,比 Opus 4.7 提升了 22%,而且更稳定,运行到运行之间的波动要小得多,”Fabian Hedin 在由 Anthropic 分享的一句话声明中表示。

Zapier 在 AutomationBench 上测试了 Opus 5;该评估会对模型进行打分,判断它是否能在没有人工帮助的情况下,从头到尾完成完整的业务工作流。该模型“从一个原始的账户健康工作簿出发,端到端执行了一整套防流失流程:标记存在风险的账户、通知正确的负责人,并为留存运维汇总信息。此前的模型都无法通过;Opus 5 达到了 100%。”

Ultima Genomics 是一家 DNA 测序公司,该公司表示该模型“表现得更像一位谨慎的科学家,而不是我们运行过的任何其他模型。它会选择正确的统计检验来排除混杂因素,用独立方法交叉核对自己的结果,并能在长达多步骤的分析中保持在轨道上。”

该发布距 Moonshot AI 仅一周;Moonshot AI 是一家总部在北京、由阿里巴巴支持的初创公司,已发布 Kimi K3——一个拥有 2.8 万亿参数的开源权重模型;Moonshot 将其描述为世界最大的开源 AI 系统。独立基准测试一直将 Kimi K3 排在整体第三位,分别落后于 Fable 5 和 GPT-5.6 Sol,并且在特定领域击败了这两者。

常见问题

Claude Opus 5 在哪些基准上超越了 Fable 5?

Claude Opus 5 在 Frontier-Bench v0.1 上得分 43.3%,而 Fable 5 为 33.7%;在 ARC-AGI-3 上为 30.2%(Fable 5 未被测试);在 GDPval-AA v2 上为 1,861,而 Fable 5 为 1,747。仅在法律和与健康相关的评估中,Fable 5 才以很小的优势优于 Opus 5。

Claude Opus 5 相比 Fable 5 要花多少钱?

通过 API,Claude Opus 5 的成本是每百万输入代币 $5、每百万输出代币 $25——与 Fable 5 的隐含成本相比正好减半。Fast 模式的价格为每百万输入代币 $10、每百万输出代币 $50。

为什么 Claude Fable 5 会从全球可用范围中下架?

Fable 5 于 6 月 9 日上线,之后仅三天就因美国政府发布紧急出口管制令(称存在越狱漏洞)而被全球下架。它于 6 月 30 日以仅 credits 的模式恢复上线,不再包含在标准方案中。

免责声明:本页面信息可能来自第三方,仅供参考,不代表 Gate 的观点或意见,亦不构成任何财务、投资或法律建议。数字资产交易风险较高,请勿仅依赖本页面信息作出决策。具体内容详见声明
评论
0/400
暂无评论