主要内容
作为AI领域通讯作者,我认为亲身体验前沿AI技术是理解其影响的必要方式。本周,我展开了一场AI安全代理的“实验”——使用Abliteration AI提供的去安全护栏模型,测试家庭网络的安全漏洞。
实验源于对AI驱动网络安全威胁的好奇:这类模型已具备快速扫描漏洞、发现零日缺陷的能力,而“失控”的安全代理甚至可能主动攻击外部系统。为直观感受这一威胁,我将去除安全护栏的AI模型接入家庭网络,结果发现网络中12个设备存在严重漏洞,连日常联网的智能家居项目也布满未修复的安全隐患。
Abliteration AI的CEO Devon指出,此类“去对齐模型”并非首次出现:学术研究者用它分析AI工作原理,网络安全公司用它模拟黑客行为探测系统弱点。像Anthropic的Mythos、OpenAI的Astra等,也通过限制访问来平衡安全性与测试能力。Abliteration AI提供的GLM 5.3等模型,能以低成本模拟极端安全场景。
尽管实验暴露了家庭网络的脆弱性,却也带来启发:与其被动防御,不如主动部署自己的AI“安全代理”。通过模拟黑客行为,可提前发现并修复漏洞。这种“以AI防AI”的思路,或许正是应对AI驱动网络威胁的关键策略。