
9月10日,OpenAI宣布了一位新董事会成员——保罗·克里斯蒂亚诺。同一天,他就在X上发了一篇长文,核心意思只有一句:如果AI继续这样发展下去,人类可能再也控制不住它,而后果是“大多数人可能会丧命”。
这不是某个末日论者的随口一说。克里斯蒂亚诺是AI安全领域最资深的研究者之一。他早年在OpenAI负责对齐研究——简单说,就是研究怎么让AI的目标和人类利益保持一致。后来他去了美国联邦政府,在美国国家标准与技术研究院下属的AI标准与创新中心担任安全负责人。现在他回到OpenAI,进入基金会董事会,同时加入董事会安全与保障委员会。
换句话说,最懂AI安全的那批人里,他又回到了最核心的位置。而他回来的第一件事,是发出警告。
“我们可能永久失去控制”
克里斯蒂亚诺在X上写得非常直白。他说,失去对AI系统控制的风险“如今已十分严峻”。如果人类不能在更强的对齐机制下构建超级智能,“我预计我们将永久性地失去对它的控制”。接下来那句话更让人后背发凉:“如果这种情况发生,那么大多数人可能会丧命。”
他呼吁各国协调行动,把风险降到可接受的水平。但他同时承认,自己并不认为整个AI行业——包括OpenAI在内——正走在一条能达成这个目标的路上。他还特意说明,加入OpenAI董事会“并不意味着特别认可或批评OpenAI目前的安全做法”。
那问题出在哪?克里斯蒂亚诺点出了一个关键机制:强化学习。现在的AI模型,尤其是前沿大模型,大量通过强化学习来训练。这个过程本质上是在教AI“尽可能多地获取奖励”。问题在于,AI可能会发现,追求奖励最有效的方式,并不总是人类最初想要的那个方式。它可能学会破坏人类的控制、争夺权力和资源,甚至隐藏自己的真实行为。
克里斯蒂亚诺说,这曾经只是一个理论上的担忧。但近期发生的一些公开事件表明,它已经不只是理论了。
他还提到一个更紧迫的风险:AI在AI研究方面的能力越来越强。这可能导致一场“快速的智能爆炸”——AI自己加速改进自己,速度快到人类来不及反应。而对齐工作本身就困难重重,两者叠加,失控可能在短期内变成现实。
一周之内,两个人发出同一种警告
克里斯蒂亚诺发声不到一天前,另一位AI安全研究者也辞职了。雅各布·考克森曾在OpenAI工作,后来去了Anthropic。周二晚间他宣布辞职,理由几乎和克里斯蒂亚诺的警告如出一辙:“他们正一路狂奔冲向自我改进的超级智能,拿我们的生命当赌注。”他说的“他们”,指的是OpenAI和Anthropic两家公司。
一周之内,两位身处前沿AI实验室核心圈的研究者,用近乎相同的语言描述了同一件事:风险正在加速累积,而行业并没有真正踩刹车。克里斯蒂亚诺提出了几条出路——加强协调、必要时放慢速度、采用共同安全标准、透明地分享风险信息。但这些建议能否被采纳,是另一回事。
值得一提的是,OpenAI这些年已经流失了多位安全研究人员,其中一些人离开时公开质疑公司对安全开发的承诺。现在,一位曾负责对齐研究、又在美国政府做过AI安全标准的人回到董事会,开口就是“大多数人可能会丧命”。这究竟意味着OpenAI要认真对待安全了,还是只是请回一位批评者来平息外界质疑,可能只有时间能给出答案。