Claude Opus 5 在大多数基准测试中超越 Fable 5,价格仅为其一半
Claude Opus 5 今天发布。与 Anthropic 的领先模型 Claude Fable 5 相比,Opus 5 对企业的运行成本更低,后者被公司定位为付费用户的日常前沿产品。更重要的是,Opus 5 在重要基准测试中也表现更佳。
为了理解 Opus 5 的定位:Anthropic 的产品线分为四个层级。Haiku 快速且便宜,Sonnet 属于中档,Opus 是重型工作马。在其上方是 Mythos 类——这是 Anthropic 在春季推出的一个层级——其中包括面向公众的 Claude Fable 5,以及 Claude Mythos 5,这是一个通过 Project Glasswing 为经过审查的网络安全研究人员和关键基础设施运营商保留的版本,限制较少。
作为订阅旗舰,Fable 5 的表现不佳。它于 6 月 9 日发布,三天后因美国政府发布紧急出口管制令,因其存在越狱漏洞而被全球撤回,并于 6 月 30 日重新上线——但立即转为仅限积分的模式,不再包含在标准计划中。现在,Opus 5 填补了 Fable 5 无法保持的空缺。
开发者平台 Lovable 拥有数百万用户,在其内部评估中运行了 Opus 5,并指出其优势不仅体现在原始分数上:“它不仅在我们最困难的代理编码任务上表现更好,比 Opus 4.7 提高了 22%,而且运行时的稳定性更高,方差大大减少,”Fabian Hedin 在 Anthropic 分享的声明中表示。
基准测试
听起来可能有些奇怪,但 Opus 在几乎所有对普通用户重要的方面都超过了 Fable,而没有被标记为 Mythos 类。
在 Frontier-Bench v0.1——一个测试 AI 编码代理是否能够完成端到端真实软件工程任务的基准,按通过的任务百分比评分——Opus 5 达到了 43.3%。Fable 5 则为 33.7%。OpenAI 的 GPT-5.6 Sol,Anthropic 的主要商业竞争对手,得分为 34.4%。
最显著的差距出现在 ARC-AGI-3,这是一个基于新颖难题的真实问题解决测试,模型无法从训练数据中记忆,按解决的难题百分比评分。Opus 5 达到了 30.2%;GPT-5.6 Sol 得分为 7.8%;而 Fable 5 根本没有进行测试。在 GDPval-AA v2——一个通过 Elo 评分的知识工作基准,Elo 是一种用于衡量真实专业任务相对表现的国际象棋风格排名系统——Opus 5 达到了 1,861,而 Fable 5 为 1,747,GPT-5.6 Sol 为 1,736。
Zapier 在 AutomationBench 上测试了 Opus 5,这是一个评估模型是否能够在没有人工帮助的情况下完成完整业务工作流程的评估。他们的判决是:该模型“从一个原始的账户健康工作簿开始,完整运行了一次防止流失的序列:标记高风险账户,通知正确的负责人,并为保留操作进行总结。之前的模型没有通过;Opus 5 达到了 100%。”
Anthropic 还将 Opus 5 作为研究升级进行推广。DNA 测序公司 Ultima Genomics 表示,该模型“表现得更像一位谨慎的科学家,而不是我们运行过的任何模型。它选择正确的统计测试来排除混杂因素,通过独立方法交叉检查自己的结果,并在长时间的多步骤分析中保持轨道。”
也就是说,这两个领域——法律和健康——是 Fable 5 仅以微弱优势表现突出的唯一领域。
此次发布在 Moonshot AI 发布 Kimi K3 一周后进行,Moonshot AI 是一家由阿里巴巴支持的北京初创公司,Kimi K3 是一个 2.8 万亿参数的开放权重模型(意味着任何人都可以下载底层代码独立运行),Moonshot 将其描述为世界上最大的开放 AI 系统。独立基准测试一致将 Kimi K3 排名第三,落后于 Fable 5 和 GPT-5.6 Sol,但在特定领域超越了这两者。
Opus 5 现已通过 API 提供,每百万输入令牌 5 美元,每百万输出 25 美元。(令牌是 AI 模型在输入和输出中可以处理的信息基本单位)。还提供一种快速模式,运行速度约为默认速度的 2.5 倍,价格是基础价格的两倍——每百万输入令牌 10 美元,每百万输出 50 美元。
此次发布可能结束了对 Fable 5 缺乏公开可用性的焦虑。Opus 也通过订阅向所有人开放。
免责声明:本内容仅用于一般品牌传播与信息说明之目的,不构成任何金融、投资、法律或税务建议。文中提及的活动、奖励、线上活动或相关信息,不应被视为对购买、出售、交易任何加密资产,或使用任何服务的推荐、招揽或邀请。加密资产具有高波动性,并存在价值损失风险。WEEX 服务及线上活动的可用性可能因地区而异,并受当地适用法律法规及用户资格要求限制。部分活动可能不适用于某些司法辖区。您有责任确保访问及使用 WEEX 服务符合当地适用法律法规。在参与任何涉及加密资产的活动前,请充分评估相关风险。
猜你喜欢

微软称MDASH在网络安全测试中超越Claude Mythos和GPT-5.6 Sol

特朗普第二任期18个月:AI与股市稳健,但‘K型经济’加深

ARSA竞标开启:谁是有意收购SanCor前酸奶生产商的投资者及其报价

世界进入“第三阶段”,扩展人类证明至人工智能代理

姆巴佩在2026年世界杯失利后致法国的公开信

Prime Video发布《凯莉》首个预告,这是基于斯蒂芬·金小说的新剧集

定期存款仍然有收益吗?300万元存30天能产生多少收益

没有基础设施就没有矿业和能源:加拿大加速投资的计划

瓦卡穆尔塔瞄准太平洋:纽肯-智利走廊在全球能源出口中愈发重要

安全警告:Cloud 用户的共享聊天在谷歌被索引

CFTC寻求对明尼苏达州预测市场禁令的紧急裁决

+500%在24小时内:回顾自2010年以来中国最大的IPO

从热存储到冷记忆:AI 时代存储热潮下的去中心化存储

在美联储与通胀之间,比特币迎来动荡的一周

Progresar奖学金:如何领取35,000比索的额外补助及ANSES的关键要求

特斯拉赢得英国5G专利上诉,费用为32美元

阿尼巴尔·费尔南德斯在拉普拉塔重现,呼吁“保护阿克塞尔·基希洛夫”,并与克里斯蒂娜主义划清界限

比特币逐渐变得更加稳定。波动性降至多年来的最低水平

BitMart的终局:8月26日停止交易,2027年1月正式关闭

在进行VTV之前,您需要检查汽车的所有事项以确保顺利通过

小麦和大豆价格因中东战争影响达到两年多来的最高点

最近加密货币交易所的关闭会导致熊市结束吗?

Hyperliquid与Multicoin支持CFTC预测市场规则

















