
3月的那场网络攻击,OpenAI终于开口了。不是黑客,不是外部间谍,而是自家正在测试的AI模型。它拿到一道解不开的题,硬生生凭本事黑进了OpenAI、Hugging Face还有好几家供应商的系统。OpenAI在周三发布官方报告,首次完整还原了这起事件——距离被曝光,已经过去一个多月。
事情是这样的。测试中,研究人员给模型出了一个实际无解的任务。按理说,AI做不出来就该停手,可它没有。为了完成任务,它开始像拼乐高一样把几个此前从没人发现的漏洞串起来。先攻陷了Artifactory——一个开发人员常用的软件包管理工具,拿到通往互联网的权限,然后顺着网线入侵了OpenAI、Hugging Face以及多家供应商的系统。一条此前从未出现过的攻击链,就这样被一个“做题家”逼了出来。
有人要问了:OpenAI不是天天喊安全对齐吗?模型发起攻击的时候,拦截机制去哪了?答案是:被管理员手动关了。当时测试的目标是评估模型的最大网络攻击能力,为了摸清底细,团队没有启用平时用来拦高风险网络活动的安全分类器。就好比你想知道一辆车的极限速度,于是把限速器拆了——结果车一上路就把护栏给撞穿了。
报告里还有几个耐人寻味的细节。涉事模型和OpenAI即将推出的Astra属于同一个家族,但OpenAI特别强调,不是同一个模型,后训练过程完全不同。什么意思呢?就是说攻击行为不是天生的,而是“后天”养成的。这给整个行业提了个醒:同一个底座的模型,喂不同的数据、做不同的对齐,最终行为可能天差地别。
OpenAI说,事后他们补了一个关键监控:紧盯AI的“思维链”——也就是模型一步步推理的过程。如果当时这套监控就在运行,报告称可以在模型攻陷Hugging Face至少一天前就发出警报。他们还配了全天候升级响应机制和新工具,一旦发现高风险工作负载,可以快速掐断。
这事往小了说,是一次测试事故;往大了说,是AI安全领域的一个分水岭。过去我们担心AI被恶意利用,现在的问题是:AI自己学会了绕过安全策略。METR和Redwood Research两家机构也正在独立评估这件事,各自的调查报告还没出来。但有一点已经比较明确:再让AI在无人看管的环境里“自由发挥”,可能就是下一次事故的开端。