Claude Fable 5 明日全球重新上架:软件工程能力显著提升
Anthropic 宣布 Claude Fable 5 将于明日全球重新上架, 该模型在软件工程、科学研究和视觉任务中达到 SOTA 水平, 且定价大幅降低。据 Anthropic 官方博文,Fable 5 在处理长且复杂的任务时领先优势最明显。

Claude Fable 5 软件工程生产力突破
Fable 5 在软件工程领域表现出极高的生产力。据 Stripe 报告, 该模型能将数月的工程量压缩至数日。在一个拥有 5000 万行 Ruby 代码的库中,Fable 5 仅用 1 天就完成了原本需要整个团队手动执行两个多月的全库迁移任务。
在 Cognition 的 FrontierCode 评测中,Fable 5 在中等强度投入下的得分在尖端模型中最高。
高级推理与视觉任务表现
在知识工作与视觉任务方面,Fable 5 展现出强悍的推理能力。在 Hebbia 针对高级推理的金融评测集 (Finance Benchmark) 中,Fable 5 获得了所有模型中的最高分, 显著提升了基于文档的推理及图表解析能力。
该模型能够从详细的科学图表中提取精确数字, 并能仅凭屏幕截图重建 Web 应用的源代码。在视觉驱动任务中,Fable 5 仅凭裸截图 (vision-only harness) 就通关了 Pokémon FireRed, 而此前的模型即使使用辅助工具也难以完成。
安全分类器更新与重新部署细节
此次重新部署是在与美国政府进行一系列沟通后决定。Anthropic 为 Fable 5 配置了新的一组分类器, 旨在更精准地拦截和屏蔽网络安全相关任务。在短期内, 部分常规的编程与调试任务可能会回退至 Opus 4.8 执行。
Anthropic 计划在未来几周持续优化这些分类器, 以减少误报, 并更好地区分恶意使用与合法请求。
建立 AI Jailbreak 共识框架
为了应对安全挑战,Anthropic 已开始与 Amazon、微软、谷歌等 Glasswing 合作伙伴起草一套共识框架, 用于评估 AI jailbreak(越狱) 的严重程度以及开发者的应对机制, 并邀请其他行业伙伴加入。
此外,Anthropic 正在扩大与美国政府在模型测试与安全保障方面的合作, 包括在模型发布前提供评估访问权限, 共享关于 jailbreak 和误用的信息, 以及投入专项资源进行联合研究。
Claude Fable 5 的回归标志着 Anthropic 在追求极高性能与满足政府安全监管之间寻求平衡。随着新分类器的迭代, 其在软件工程等高生产力场景的实际可用性将进一步明确。

评论 0