一种新技巧揭示AI模型的内在思维 - AI News
一种新技巧揭示AI模型的内在思维

一种新技巧揭示AI模型的内在思维

2026-08-11

新闻要点

最近,德国图宾根大学等机构的计算机科学家发现一种提取前沿AI模型隐藏推理的方法,该方法揭示中国Moonshot AI的Kimi K3模型与Claude Opus 4.8、GPT 5.6 Sol的推理痕迹高度相似(未因果证明蒸馏),还可恢复密码等信息(漏洞已修复),OpenAI、Anthropic等多家模型提供商曾存在此漏洞。

- 新方法提取AI隐藏推理,Kimi K3与Claude Opus等推理痕迹相似

- 方法可泄露密码等信息,多家模型商存在该漏洞

- 同系列小模型因对齐训练少易解密隐藏推理

- 蒸馏技术引发中美AI模型争议,研究未因果证明蒸馏

主要内容

计算机科学家近期发现一种可提取前沿AI模型处理复杂问题时隐藏“思考”过程的方法。研究显示,部分中国模型可能通过“蒸馏”技术(从美国模型中提取推理信息)实现能力迁移,尽管无法确定因果关系,但测试的OpenAI、Anthropic、Google等模型及中国Moonshot AI的Kimi K3存在推理轨迹相似性。该方法还可从模型内部推理中恢复密码、API密钥等个人信息,但相关漏洞已被修复。

德国蒂宾根大学等机构的研究团队指出,通过应用程序接口(API)访问的前沿模型中,开源模型Kimi K3的推理输出与Claude Opus 4.8、GPT 5.6 Sol的隐藏推理轨迹高度相似,而DeepSeek和Inkling模型未表现出这种相似性。Moonshot AI和Z.ai未回应置评请求。

“蒸馏”是复制现有模型能力的常用技术,尤其在开源模型开发中广泛应用。但近期因中国AI公司被指通过蒸馏复制美国模型而引发争议。今年2月,OpenAI曾向美国立法者指控DeepSeek复制其模型;6月,Anthropic称阿里巴巴系统蒸馏其模型构建Qwen。

研究团队解释,AI模型通过“思维链”分解问题,公司通常加密推理过程。攻击原理是利用较小模型(计算成本低)较少的“对齐训练”,通过发送加密推理轨迹使其暴露隐藏推理步骤。该漏洞虽已修复,但研究提示需加强对模型推理透明度的监管。