GLM-5.2 领跑开源权重模型,GDPval-AA 智能体评测位列全球第三
智谱 AI 发布开源权重模型 GLM-5.2, 在衡量真实世界智能体能力的 GDPval-AA 评测中表现出色, 目前位列全球第三。据 Artificial Analysis 报道,GLM-5.2 在该 benchmark 中获得 1524 Elo 分数, 在开源权重模型中处于绝对领先地位。

GLM-5.2 在 GDPval-AA 评测中的排名表现
GDPval-AA 是一项衡量模型处理具有经济价值的真实知识工作能力的评测集, 重点测试长路径、多轮对话的智能体任务。GLM-5.2 在该项测试中位列全球 第三名, 仅次于 Claude Fable 5 (1783 Elo) 与 Claude Opus 4.8 (1615 Elo), 且性能与 GPT-5.5 xhigh (1509 Elo) 基本持平。
在开源权重模型阵营中,GLM-5.2 以显著优势领先。排名第二的开源模型 MiniMax-M3 分数为 1408 Elo, 与 GLM-5.2 之间存在明显差距。
跨模型能力对比与智能体表现
据 Artificial Analysis 的数据,GLM-5.2 的表现超过了多款闭源商业模型。其得分高于 Google 的 Gemini 3.5 Flash (1357 Elo)、Qwen 3.7 Max (1289 Elo) 以及 Muse Spark (1158 Elo)。
该评测的核心在于智能体 (agent) 能力。在总计 1,999 场对局中,GLM-5.2 处理每个任务的平均轮次约为 31 轮, 展现了极强的长路径任务执行能力。
多维度智能指标综合领先
除了在 GDPval-AA 上的突破,GLM-5.2 在其他关键索引中同样表现强劲。该模型目前在 Artificial Analysis Intelligence Index 的开源权重模型中排名第一, 并在 Agentic Index 与 AA-Briefcase 两项指标中均位列全球 第三名。
GLM-5.2 通过在多项衡量智能体能力与综合推理的 benchmark 中取得高分, 证明了开源模型在处理复杂、多步骤商业任务上的竞争力正迅速逼近顶级闭源模型。

评论 0