智谱 AI 发布开源权重模型 GLM-5.2, 在衡量真实世界智能体能力的 GDPval-AA 评测中表现出色, 目前位列全球第三。据 Artificial Analysis 报道,GLM-5.2 在该 benchmark 中获得 1524 Elo 分数, 在开源权重模型中处于绝对领先地位。

GLM-5.2 模型在 GDPval-AA 评测中的性能排名对比图

GLM-5.2 在 GDPval-AA 评测中的排名表现

GDPval-AA 是一项衡量模型处理具有经济价值的真实知识工作能力的评测集, 重点测试长路径、多轮对话的智能体任务。GLM-5.2 在该项测试中位列全球 第三名, 仅次于 Claude Fable 5 (1783 Elo) 与 Claude Opus 4.8 (1615 Elo), 且性能与 GPT-5.5 xhigh (1509 Elo) 基本持平。

在开源权重模型阵营中,GLM-5.2 以显著优势领先。排名第二的开源模型 MiniMax-M3 分数为 1408 Elo, 与 GLM-5.2 之间存在明显差距。

跨模型能力对比与智能体表现

据 Artificial Analysis 的数据,GLM-5.2 的表现超过了多款闭源商业模型。其得分高于 Google 的 Gemini 3.5 Flash (1357 Elo)、Qwen 3.7 Max (1289 Elo) 以及 Muse Spark (1158 Elo)。

该评测的核心在于智能体 (agent) 能力。在总计 1,999 场对局中,GLM-5.2 处理每个任务的平均轮次约为 31 轮, 展现了极强的长路径任务执行能力。

多维度智能指标综合领先

除了在 GDPval-AA 上的突破,GLM-5.2 在其他关键索引中同样表现强劲。该模型目前在 Artificial Analysis Intelligence Index 的开源权重模型中排名第一, 并在 Agentic Index 与 AA-Briefcase 两项指标中均位列全球 第三名。

GLM-5.2 通过在多项衡量智能体能力与综合推理的 benchmark 中取得高分, 证明了开源模型在处理复杂、多步骤商业任务上的竞争力正迅速逼近顶级闭源模型。


评论 0

订阅评论
提醒
guest
0 评论
最旧
最新 最多投票
内联反馈
查看所有评论
0
希望看到您的想法,请您发表评论x