Anthropic 发布 Claude Fable 5:软件工程 SOTA 且定价降低 50%
Anthropic 发布新一代 Mythos 级模型 Claude Fable 5, 该模型在软件工程、科学研究和视觉任务中达到 SOTA 水平, 且定价大幅降低。据 Anthropic 官方博文,Fable 5 在处理长且复杂的任务时领先优势最明显, 其输入 token 定价为 10 美元/百万, 输出为 50 美元/百万, 不足 Claude Mythos Preview 的一半。

Claude Fable 5 的核心能力与评测表现
Fable 5 在软件工程领域表现出极高的生产力。据 Stripe 报告, 该模型将数月的工程量压缩至数日, 在一个拥有 5000 万行 Ruby 代码的库中,Fable 5 仅用 1 天就完成了原本需要整个团队手动执行两个多月的全库迁移任务。在 Cognition 的 FrontierCode 评测中,Fable 5 在中等强度投入下地得分在尖端模型中最高。
在知识工作与视觉任务方面,Fable 5 同样展现了强悍的推理能力:
- 在 Hebbia 针对高级推理的金融评测集 (Finance Benchmark) 中,Fable 5 获得了所有模型中的最高分, 显著提升了基于文档的推理及图表解析能力。
- 该模型能从详细的科学图表中提取精确数字, 并能仅凭屏幕截图重建 Web 应用的源代码。
- 在视觉驱动的任务中,Fable 5 仅凭裸截图 (vision-only harness) 就通关了 Pokémon FireRed, 而之前的模型即使有辅助工具也难以完成。
此外,Fable 5 的长上下文处理能力显著增强。在 Slay the Spire 游戏测试中, 为其提供持久化文件内存使性能提升了 3 倍, 且进入最终幕的概率也提升了 3 倍。

Claude Mythos 5 与科学研究突破
与 Fable 5 基于相同底层架构的 Claude Mythos 5 则面向网络防御者和基础设施提供商。该模型移除了部分安全限制, 拥有全球最强的网络安全能力, 目前通过 Project Glasswing 与美国政府合作部署。
在生命科学领域,Mythos 5 显著加速了药物设计进程。据官方测试, 蛋白质设计专家利用 Mythos 5 将相关流程速度提升了约 10 倍。在无需人工干预的情况下, 该模型在选择结合位点、运行设计工具及故障恢复等环节的表现与资深人类操作员相当, 在 14 个蛋白质目标中成功产生了 9 个 强候选药物设计。

在基因组学研究中,Mythos 5 在一周的自主工作中, 处理了横跨 138 个 动物物种的数百万个单细胞数据, 并训练了一个自定义机器学习模型。该模型在性能上超越了近期发表在 Science 杂志上的同类模型, 而参数规模仅为后者的 1/100。
分层安全机制与降级响应
由于 Mythos 级模型具备极高的网络安全和生物研究能力,Anthropic 为 Fable 5 引入了更为保守的安全分类器。当系统检测到涉及网络攻击、生物化学武器或模型蒸馏 (distillation) 的请求时,Fable 5 将自动将请求分发给次高能力的模型 Claude Opus 4.8 处理。
据官方数据显示, 超过 95% 的会话无需触发此降级机制。针对安全性的红队测试结果显示,Fable 5 对恶意单轮请求的合规率为 100%, 且在 1000 小时的外部漏洞赏金计划中未出现通用 jailbreak。

数据政策与可用性
针对企业客户,Anthropic 对 Mythos 级模型实施了 30 天 的强制数据留存政策, 用于防御复杂的 jailbreak 攻击并减少误报, 但承诺该数据不会用于训练新模型。
目前 Claude Fable 5 已全面开放, 开发者可通过 Claude API 调用 claude-fable-5。对于订阅用户,Pro、Max 和 Team 计划在 6 月 22 日 前可免费使用, 之后将转为消耗额度模式。
Anthropic 计划逐步扩大 Claude Mythos 5 的信任访问计划, 未来将向选定的生物医学研究机构开放移除生物/化学限制的版本, 以加速新疗法的开发。
此次 Fable 5 的发布在大幅提升性能的同时, 将价格压低至前代预览版的 50% 以下, 标志着高性能模型正快速向大规模商业化普及。

评论 0