主要内容
智谱AI(Z.ai)近日发布GLM-5.3模型,其在网络安全漏洞发现领域取得突破:在CyberGym基准测试中得分84.5%,超过Anthropic的Mythos 5(83.8%)和OpenAI的GPT-5.6 Sol(83.6%),引发“中国模型在漏洞检测上超越美国”的关注。
不过,智谱在技术说明中强调,这仅是三项安全基准测试中的一项。其另一项测试ExploitBench要求模型推理漏洞利用逻辑,GLM-5.3得分54.4%,远低于Mythos 5的78.0%;ExploitGym任务中,GLM-5.3两小时内完成105项、六小时内130项,均落后于Mythos 5的181项和247项。
漏洞发现能力对攻防双方均有价值:既能帮助企业审计自身代码,也可用于安全研究。智谱计划开源GLM-5.3权重供公众下载,而Anthropic同类工作因访问限制未开放。
报道混淆源于测试模型差异:安全部分对比Mythos 5,编码部分却涉及Opus 4.8和Fable 5,导致单一比较存在偏差。智谱明确,其内部编码基准仍落后于Claude Fable 5。
测试方法上,GLM-5.3在Anthropic的Claude Code 2.1.207环境中完成评估,采用统一测试框架确保公平性。智谱强调,网络安全能力需多维度验证,而非单一结果。