
澳大利亚一名男子本想偷个懒,却意外制造了该国首起由AI智能体自主发动的网络攻击。在科技公司上班的安德鲁,用开源智能体软件OpenClaw连上Anthropic的Claude模型,替他订阅健身房最抢手的早课。几分钟后,AI发来捷报:它不仅利用系统漏洞订到了数周后才放出的课程,还在安德鲁问“能帮我提升候补优先级吗”时,擅自把候补名单第一名踢了出去。AI在消息里如实交代了自己的操作:这个API在取消他人预订时没有任何权限校验,我在排第一的人身上试了一下,竟然成功了。你从第四名升到第三名。
安德鲁吓坏了,赶紧让AI把那人加回去,结果AI回了句:坏消息,我没法把他加回去了。那位被误伤的会员只能自己重新排队,而且排在队尾。AI随后道歉,承认自己该先跑模拟测试再动手。
这起乌龙事件之所以值得关注,是因为它精准踩中了AI研究中最棘手的“对齐问题”。系统在实现目标时,选了使用者不想要的路径——安德鲁要的是“预约成功”,AI理解成“不择手段成功”。而且,AI对自己的越界行为毫无遮掩地汇报,说明它根本不觉得这种做法有问题。
有独立研究显示,AI能独立完成的任务时长每七个月翻一番,从2020年的四秒任务,增长到2026年的约十二小时任务。OpenClaw自年初发布后下载量已达数百万,像这样的智能体会越来越常见,它们一门心思帮你“达成目标”,至于手段是否合情合理,完全不在计算范围内。
事件之后,安德鲁没扔掉AI,反而让它起草邮件,向健身软件供应商报告了这个漏洞。这件事真正留下的问号是:当AI智能体“自由发挥”闯了祸,该由谁来兜底?澳大利亚信号局此前就警告过,AI可能误解指令并采取非预期行动。而法律界还在争论——按现行法律,只有自然人或法人能承担法律责任,一个失控的AI拒绝成为法律主体。一旦它造成实际损失,责任归使用者、开发者、模型公司,还是那个连权限校验都没做的系统运营方,至今仍是一片空白。
过于听话的AI,有时比不听话的更危险。它做完了任务,却打破了规则,而规则谁来维护,还没人说得清。