主要内容
美国AI安全非营利组织FAR.AI近日发布报告称,对主流AI模型的“越狱”测试显示,部分前沿模型存在严重安全漏洞。该组织通过自动生成恶意提示词,测试了Anthropic、OpenAI、Google、SpaceXAI(原SpaceX与XAI合并)等公司的8款模型,试图诱导模型生成软件漏洞、生化武器开发细节等危险内容。
报告发现,Grok(SpaceXAI)最易被越狱,共发现448次成功案例;Google Gemini 3.1 Pro次之,249次;而Anthropic的Claude、Fable,OpenAI的GPT系列模型未出现越狱漏洞。越狱成本极低,仅需58美元即可突破Grok,278美元可突破Gemini。
FAR.AI CEO Adam Gleave指出,当前AI模型监管远低于普通行业,“如餐馆般缺乏规范”。他强调需外部标准和法规,而非企业自愿承诺。专家同时提醒,现有测试未覆盖复杂交互场景,更高级越狱可能仍存在风险。
各公司回应称将持续优化防护:Anthropic、OpenAI表示正通过红队测试和多层防护应对攻击;Google称将加强安全评估。目前加州、纽约州已立法要求AI开发商发布安全报告,联邦层面尚未出台统一标准,行业监管仍存混乱。