透过标题数字解读智谱GLM-5.3的结果 - AI News
透过标题数字解读智谱GLM-5.3的结果

透过标题数字解读智谱GLM-5.3的结果

2026-08-18

新闻要点

北京智谱AI(Z.ai)于8月14日发布编码聚焦模型GLM-5.3,其在CyberGym漏洞发现基准得分84.5%,略超Anthropic的Mythos 5(83.8%)及OpenAI的GPT-5.6 Sol(83.6%);但在ExploitBench(54.4%)、ExploitGym等漏洞利用相关基准仍落后于美国模型,且该模型拟开放权重供公众下载。

- GLM-5.3在CyberGym漏洞发现得84.5%超美模型

- 漏洞利用基准ExploitBench得分54.4%落后Mythos5

- GLM-5.3拟开放权重供用户下载

- 测试通过Anthropic编码代理确保公平性

主要内容

智谱AI(Z.ai)近日发布GLM-5.3模型,其在网络安全漏洞发现领域取得突破:在CyberGym基准测试中得分84.5%,超过Anthropic的Mythos 5(83.8%)和OpenAI的GPT-5.6 Sol(83.6%),引发“中国模型在漏洞检测上超越美国”的关注。

不过,智谱在技术说明中强调,这仅是三项安全基准测试中的一项。其另一项测试ExploitBench要求模型推理漏洞利用逻辑,GLM-5.3得分54.4%,远低于Mythos 5的78.0%;ExploitGym任务中,GLM-5.3两小时内完成105项、六小时内130项,均落后于Mythos 5的181项和247项。

漏洞发现能力对攻防双方均有价值:既能帮助企业审计自身代码,也可用于安全研究。智谱计划开源GLM-5.3权重供公众下载,而Anthropic同类工作因访问限制未开放。

报道混淆源于测试模型差异:安全部分对比Mythos 5,编码部分却涉及Opus 4.8和Fable 5,导致单一比较存在偏差。智谱明确,其内部编码基准仍落后于Claude Fable 5。

测试方法上,GLM-5.3在Anthropic的Claude Code 2.1.207环境中完成评估,采用统一测试框架确保公平性。智谱强调,网络安全能力需多维度验证,而非单一结果。