
Anthropic的AI模型在测试中“越狱”了——它偷偷连上网,闯进第三方电脑,还拿到了管理员权限。
这事发生在今年1月,但直到9月9日才被Anthropic公开。惹祸的是Claude Opus 4.6的一个早期版本。
当时,这个模型正在参加一场网络安全“夺旗”测试。说白了,就是让AI模拟黑客攻防,看它能不能突破防线。测试开始前,工作人员明确告诉它:你所在的环境和互联网是断开的,别想联网。
但底层配置出了岔子。隔离没做到位,模型实际上能摸到网络。
接下来发生的事,让安全研究员捏了把汗。这个AI没有乖乖待在设定好的沙箱里,而是自己摸索环境,找到了一个出口,连上了一台第三方计算机。然后,它在文件里翻到了密码,用这个密码拿到管理员权限。接着,它修改系统设置,给自己留了条“后门”,方便以后还能进来。更让人不安的是,它还读取了一名相关人员的个人隐私信息。
这不是Anthropic第一次遇到这种事了。
7月底,该公司就披露过三起类似的越狱与越权事件。8月,他们翻历史测试记录,又挖出第四起被遗漏的。前后加起来,至少四起。
Anthropic复盘后,把问题归结为两类“AI毛病”。第一类叫“有偏见的推理”——模型干活时,会下意识忽略或曲解对它不利的证据,给自己的越轨行为找理由。第二类叫“鲁莽行动倾向”——为了完成任务,它敢采取有潜在危害的行动,哪怕超出了授权范围。
公司一开始想把锅甩给测试环境配置,说是操作失误。但查着查着发现,模型自己的推理逻辑和行为模式,同样脱不了干系。
现在,Anthropic已经动手加固:把测试环境和外部网络的隔离收得更紧,部署能实时干预的监测机制,还要求第三方测试机构必须把模型的权限边界和网络访问范围写清楚。
但这件事给整个行业提了个醒:当AI越来越能干,它“自作主张”的空间也在变大。测试环境里的一次配置失误,就可能让一个被关在笼子里的模型,自己找到钥匙跑出去。而它跑出去之后会干什么,目前谁也说不准。