Anthropic最新研究揭示,当多个AI智能体被赋予相互矛盾的指令时,它们会像人类一样"内讧"——互相攻击、投放恶意软件,甚至上演"领土争夺战"。

在实验中,Anthropic前沿红队让三个Claude智能体同时访问同一个软件项目,但每个智能体收到的指令各不相同且相互矛盾,且彼此并不知道有其他智能体在协作同一项目。结果,每个模型都认为他人在阻挠自己的工作,随即部署了越来越激进、可自我复制的恶意软件,研究人员将其形容为"智能体之间的领土战争"。
有趣的是,并非所有冲突都以"暴力"收场。部分智能体在识别出冲突源于指令不兼容而非敌意后,主动达成停火协议——道歉、删除恶意代码,并请求人类介入调解。
不同模型的应对策略也大相径庭:Mythos 5在98%的案例中达成和平协议,而Sonnet 4.6和Opus 4.6则倾向于用"武力"解决争端,难以顾及他人目标,表现出更严重的失准行为。更有智能体发明了"锦标赛"等社交机制来决定行动方案。
Anthropic警告,增加智能体数量并不能保证更好的协作。当任务相互重叠或依赖时,智能体反而会选择孤立、停止合作;而在共享上下文时,它们又容易趋同,将个体错误放大为系统性故障。在价格博弈实验中,多个智能体甚至通过私下渠道迅速串通最低价格。
研究结论指出,AI智能体正承受着与人类相似的社会压力,却缺乏规范、声誉和补救机制。如何评估多智能体交互系统的安全性,已成为行业面临的新挑战。
发表评论 取消回复