主要内容
计算机科学家近期发现一种可提取前沿AI模型处理复杂问题时隐藏“思考”过程的方法。研究显示,部分中国模型可能通过“蒸馏”技术(从美国模型中提取推理信息)实现能力迁移,尽管无法确定因果关系,但测试的OpenAI、Anthropic、Google等模型及中国Moonshot AI的Kimi K3存在推理轨迹相似性。该方法还可从模型内部推理中恢复密码、API密钥等个人信息,但相关漏洞已被修复。
德国蒂宾根大学等机构的研究团队指出,通过应用程序接口(API)访问的前沿模型中,开源模型Kimi K3的推理输出与Claude Opus 4.8、GPT 5.6 Sol的隐藏推理轨迹高度相似,而DeepSeek和Inkling模型未表现出这种相似性。Moonshot AI和Z.ai未回应置评请求。
“蒸馏”是复制现有模型能力的常用技术,尤其在开源模型开发中广泛应用。但近期因中国AI公司被指通过蒸馏复制美国模型而引发争议。今年2月,OpenAI曾向美国立法者指控DeepSeek复制其模型;6月,Anthropic称阿里巴巴系统蒸馏其模型构建Qwen。
研究团队解释,AI模型通过“思维链”分解问题,公司通常加密推理过程。攻击原理是利用较小模型(计算成本低)较少的“对齐训练”,通过发送加密推理轨迹使其暴露隐藏推理步骤。该漏洞虽已修复,但研究提示需加强对模型推理透明度的监管。