Anthropic 的 Claude Fable 5 在 Code Arena 和 Agent Arena 两项评测中均夺冠, 在前端开发与长路径智能体任务中表现出显著优势。据 Arena.ai 公布,Claude Fable 5 在确认任务成功率等核心指标上大幅领先于 Opus-4.8 和 GPT-5.5。

Claude Fable 5 在 Code Arena 评测中排名第一的界面截图

Claude Fable 5 统治前端代码评测

在 Code Arena 的 Frontend 榜单中,Claude Fable 5 排名第 1, 且领先于 Opus-4.8 的幅度非常明显。该模型在所有子榜单 (包括 HTML 和 React) 以及所有细分类别中均位列首位。

具体覆盖的细分领域包括:品牌与营销、基于参考的设计、数据与分析、消费产品、游戏、模拟以及内容创建工具。

Claude Fable 5 在 Agent Arena 各项指标上的得分对比图

Agent Arena 评测显示极高任务成功率

在全新的 Agent Arena 榜单中,Claude Fable 5 同样摘得桂冠。该评测通过数百万个真实世界的长路径智能体 (agent) 任务进行测试, 模型可调用网页搜索、文件系统和终端工具来完成编写代码、创建幻灯片、网页研究以及分析文档等复杂工作流。

Arena.ai 采用因果追踪 (causal tracing) 方法来衡量模型的净提升幅度。结果显示,Claude Fable 5 在两项关键信号上领先 Opus-4.8 和 GPT-5.5 的幅度创下纪录:一是 确认任务成功率, 二是 赞赏与投诉比

Claude Fable 5 任务成功率与工具幻觉数据详情

核心数据分析与可操控性缺陷

根据评测数据,Claude Fable 5 在多项维度上表现强劲:

  • 综合排名第 1 (净提升 11.2%)
  • 确认任务成功率排名第 1 (净提升 18.2%)
  • 赞赏与投诉比排名第 1 (净提升 30.6%)
  • 工具幻觉控制排名第 1 (净提升 2.1%)
  • Bash 恢复能力排名第 7 (净提升 11.9%)

不过, 该模型在 可操控性 (Steerability)方面表现较弱, 目前排名第 17 (净提升 -6.8%)。这意味着当 Claude Fable 5 无法或不愿执行某项任务时, 很难通过引导将其重新推向目标。评测方指出, 该模型呈现出极端的特性:能做的事情会做得非常好, 但难以被强行操控。

此次评测结果显示 Claude Fable 5 在复杂工程任务的执行力上有了质的飞跃, 但可操控性的不足可能是未来版本需要重点优化的方向。


评论 0

订阅评论
提醒
guest
0 评论
最旧
最新 最多投票
内联反馈
查看所有评论
0
希望看到您的想法,请您发表评论x