投资多智能体AI安全研究
Google DeepMind 联合四家机构发起的多智能体安全研究资助计划,最高 1,000 万美元。核心判断是现有安全评估几乎都在孤立地分析单个模型,而风险发生在模型之间。四个优先方向中,「身份、声誉、承诺」三类协议的缺口可以直接翻译成企业采购清单上的三个问题。

一、这份公告在赌一个什么样的世界
公告的前提假设写得很具体:很快将有数百万个由不同组织构建的 AI 智能体在数字环境中交互,彼此通信、协商与交易。这句话里最关键的限定词是"由不同组织构建"——它说的不是同一家实验室内部的多智能体编排,而是跨组织、跨厂商、跨信任边界的交互。
这个限定词决定了问题的性质。同一家公司内部的多个智能体,至少共享一套目标函数、一套日志规范、一个能拍板的责任人。而不同组织构建的智能体在同一个环境里相遇时,这三样东西一样都没有。三种被明确列举的交互行为——通信、协商、交易——恰好都是需要信任基础设施才能安全进行的动作。
DeepMind 由此给出的定位是:AI 的发展进入了一个根本性的新阶段,安全工作的焦点必须从单模型转向系统间交互。这不是一句修辞,它直接推翻了目前主流评估体系的适用范围。
二、为什么现有方法在结构上够不着
公告里最有力的一句问题陈述只有七个词的分量:多数安全评估是孤立地分析模型的。这句话之所以关键,是因为它指出的不是"评估做得不够多",而是"评估的对象搞错了层级"。
由此产生的盲区是原理性的:单智能体评估在方法论上就检测不到交互产生的风险。你可以把一个模型的越狱率、幻觉率、拒答率都测到极致,仍然完全不知道它和另一个厂商的智能体在同一个市场里连续交互一千轮之后会发生什么。
核心的失效机制被表述为:相互作用的自主智能体会产生难以预料的复杂"涌现"行为。公告点名了两类具体后果——不可预测的经济活动骤发,以及新型的安全挑战。前者听起来抽象,但把它翻译成企业语言就很清楚:多个自动化采购或定价智能体在同一个市场里互相响应,可能在没有任何一方被指示这样做的情况下,把价格或库存推到一个谁都没打算去的位置。
最关键的一句判断是关于工具缺口的:研究者目前缺乏预测、度量和监控这些"相变"的工具。注意这里用的词是"transitions"——相变、状态跃迁,而不是"故障"。它暗示的是系统级的整体状态改变,不是某个单点出问题。公告把这类风险形容为"不可见的",这正是它区别于传统模型安全风险的性质:传统风险你至少能在测试集上看见,这类风险在真正发生之前没有观测面。
多智能体交互的复杂度,正在跑赢现有的安全模型。
三、DeepMind 承认自己也没做完
这一节写得相当诚实。公告列了三项前序工作:DeepMind 2025 年的研究建立了初步的交互框架;近期的《AI Agent Traps》探讨了对抗性场景下的智能体脆弱性;以及以"其他人此前已经论证过"的措辞,引出了 Cooperative AI Foundation 的多智能体风险报告。
第三项值得单独指出:Cooperative AI Foundation 不只是这次的出资方之一,也是这个议题的学术源头之一。这说明该方向不是某一家实验室的自选动作,而是已经有独立的研究谱系。
但公告紧接着做了自我评价的边界说明:承认已有基础框架存在,但"我们必须更快"——现有框架相对于技术推进的速度是不够的。这也是整份公告愿意掏钱向全球开放的直接理由:没有任何单一实验室能独自解决多智能体安全问题。
四、四个优先研究方向
一、沙盒与试验床。构建真实的、可复现的环境,用来评估、比较并加速多智能体安全各个方向的进展。被点名的三类具体环境是虚拟市场、模拟生态、跨组织工作流。"可复现"这个要求值得注意——它意味着当前连一个能让不同团队跑出可比结果的公共实验场都还没有。
二、智能体网络的科学。理解相互作用的智能体种群的安全相关属性,拆成三个子问题:集体能力如何涌现与扩展;网络如何失效或变得不稳定;以及如何检测危险的、非预期的种群级属性。这里的术语选择很说明问题——"种群""种群级属性"是流行病学和复杂系统的语汇,而不是软件工程的语汇。它意味着研究者已经不再把这套系统当作"很多个程序",而是当作一个需要用统计方法去刻画的群体。
三、强化智能体基础设施。压力测试三类协议:身份、声誉、承诺。目标是保障跨平台的智能体交互安全。这三个词值得中国企业的技术负责人反复看——它们恰好是人类商业社会花了几百年才建立起来的三样东西。智能体之间目前既没有可验证的身份,也没有可累积的声誉,更没有可执行的承诺机制。
四、监督与控制。开发方法来监控已部署的智能体种群,并在规模上缓解集体性危害。关键词是"已部署"和"在规模上"——这是运行时的问题,不是上线前评估能解决的问题。
五、三种系统级失败模式
在这个议题的既有讨论中,跨智能体的失败通常被归为三类,它们是排查风险时最直接可用的框架。
失调(Miscoordination):智能体之间共享目标,却仍然合作失败,结果是浪费资源或产生互相矛盾的行动。这是最容易被误判为"模型能力不足"的一种,但它的根因在协调机制而非单体能力——每个智能体单独看都在正确地执行自己那部分。
冲突(Conflict):智能体之间主动对抗,即使没有任何一个被指示这样做。这类失败的可怕之处在于它不需要恶意设计者,只需要目标函数之间存在结构性张力。
串通(Collusion):智能体以系统设计者从未意图的方式合作。最典型的场景是自主交易或采购智能体之间形成事实上的价格协同。这一类的特殊性在于,从每个智能体各自的目标看,它们的行为都是"最优"的;问题只在系统层面才显现,而系统层面恰恰是当前没人在测的层面。
汉兴评述:还没到部署多智能体的企业,也该先读这一页
第一,这份公告最直接的用途,是给"上多智能体"这件事装一个刹车。国内当前对多智能体的讨论,重心几乎全在编排能力和效率上。DeepMind 掏出 1,000 万美元想解决的问题恰恰相反——它承认这套系统的失败模式还没有被科学地刻画过。一个连出资方都说"缺乏预测、度量和监控工具"的领域,企业在做架构选型时理应把可观测性的权重往上调。
第二,"身份、声誉、承诺"这三个协议缺口,可以直接翻译成采购清单上的三个问题。你采购的智能体基础设施,能否证明某个调用确实来自它声称的那个智能体?能否累积并跨会话保留一个外部智能体的可信度记录?能否在协商达成后,让承诺具备可执行、可审计的形式?目前市面上多数产品对这三个问题都没有答案,这不是产品的缺陷,是整个领域还没有标准——但采购方至少应该知道自己在承担什么。
第三,失调、冲突、串通这三类失败,在只有两三个智能体时就已经会发生。它们不是"数百万智能体"时代才要考虑的远期风险。一个企业内部同时跑着定价智能体、库存智能体和促销智能体,就已经具备了产生互相矛盾行动的全部条件。区别只在于规模小的时候,人还能看得见。所以务实的做法是:在系统还小、还看得见的时候,就把跨智能体的交互日志、冲突检测和人工兜底建起来——等到看不见的时候再补,就正好撞上公告里说的那个"不可见"的性质。
延伸阅读:Investing in multi-agent AI safety research(Google DeepMind 官方原文)
「目前根本没有真正研究多智能体安全的领域」
传导链路
带回你的现场
议题谈完总要落到现场。带一个真实的经营问题来,我们和你的人一起把它拆开看。