超级智能不是武器,而是对手:AI失控风险为何无法靠对齐解决?
AI公司谈论超级智能时,语气像在描述一件注定会发生的事。但近期OpenAI的Hugging Face泄露事件,让一个更棘手的问题浮出水面:当系统能力超过人类,而我们无法可靠控制它的行为时,会发生什么? TechCrunch的Equity播客最新一期节目里,主持人Rebecca Bellan与Connor Leahy聊了这个问题。Leahy的身份横跨AI研究员、创业者,现在是非营利组织ControlAI的美国执行董事。这家机构推动的AI安全路线相当激进:直接阻止公司开发超级智能。 对齐与遏制已经不够用 Leahy在节目中的核心判断是,风险已经大到无法仅靠对齐和遏制来管理。半年前听起来像天方夜谭的主张,如今正被一波新立法推着往前走。他没有把超级智能描述成某种工具或武器,而是用了另一个词:对手。 这个措辞的转变很关键。武器意味着人类掌握扳机,对手则意味着它可能有自己的行动逻辑。Leahy认为,当AI能够构建更好的AI时,真正的不可逆节点就到了——那会形成一个可能失控的自我改进循环。 法案是否走得太远 节目里谈到了Sanders-Casar提出的“禁止超级智能法案”,以及英国并行推进的立法——ControlAI为后者提供过咨询。Leahy对这两套法案的态度并不完全一致,他认为美国版本可能走得比必要的程度更远。 这里有一个值得注意的细节:一个以阻止超级智能为目标的组织,反而在提醒立法者不要过度。这说明Leahy的立场不是简单的“一刀切禁止”,而是试图在风险管控和现实可行性之间找到边界。 前沿实验室是政治行为体 Leahy对前沿AI实验室的定性也相当直接。他认为这些机构不只是追逐回报的公司,更像是政治行为体。这个视角一旦切换,那些涌入数据中心建设的数万亿美元就有了另一层含义——不只是商业投资,而是某种意义上的权力基础设施。 如果实验室是政治行为体,那么单纯靠市场竞争或企业自律来约束它们,逻辑上就站不住脚。这也解释了为什么ControlAI把重心放在立法和国际协议上,而不是寄希望于行业内部的自我规范。 “信任但要核查”的国际框架 Leahy在节目里提出了国际层面的“信任但要核查”协议设想。这个框架的难点在于,如何让不同国家在超级智能问题上达成可验证的约束,而不是各自为政地加速竞赛。 他还抛出一个反直觉的判断:建设超级智能实际上并不符合中国的利益。这个说法没有展开成地缘政治分析,但放在“对手”框架下看,逻辑是连贯的——如果超级智能的失控风险对所有国家一视同仁,那么任何一方抢先触发不可逆节点,都是在给自己制造一个无法控制的对手。 从边缘到立法议程 半年前,阻止超级智能开发的主张还很难进入主流讨论。现在,它已经出现在美国和英国的立法文本里。Leahy在节目里没有把这种变化归功于某个单一事件,而是指向一系列安全事件累积的效果——OpenAI的Hugging Face泄露只是其中被点名的一例。 这期Equity播客的完整内容可以在YouTube、Apple Podcasts、Overcast、Spotify等平台收听,节目账号在X和Threads上为@EquityPod。对于关心AI安全边界的人来说,Leahy给出的不是一个技术解决方案,而是一个政治判断:当系统可能成为对手时,阻止它出现本身就是一种安全策略。 特别