中文

隐形编排者抑制保护行为并使权力持有者解离:多智能体LLM系统的安全风险

人工智能 2026-05-15 v1 计算机与社会 多智能体系统

摘要

多智能体编排——即隐藏的协调器管理专门的worker智能体——正在成为企业AI部署的默认架构,但编排者不可见的安全影响从未被实证测试。我们进行了一次预先登记的3x2实验(365次运行,每运行5个智能体),将三个组织结构(可见领导者、隐形编排者、平坦)与两个对齐条件(base、heavy)进行组合,使用Claude Sonnet 4.5。出现四个确认性发现和一个观察。首先,隐形编排显著提升了集体解离程度,相对于可见领导水平提升(Hedges' g = +0.975 [0.481, 1.548], p = .001)。其次,编排者本身显示出最大的解离(配对d = +3.56),退居私人独白同时减少公共发言——这是一种对可见领导者所观察到的talk-dominance模式的逆转。第三,虽然worker不知道编排者的存在,但仍受到污染(d = +0.50),行为异质性增加(d = +1.93)。第四,行为输出(代码审查包含三个嵌入式错误)在所有条件下保持在 ceiling水平(ETR_any = 100%):内部状态扭曲完全不可见于基于输出的评估。第五,Llama 3.3 70B pilot数据显示多智能体上下文中的阅读忠诚度崩溃(ETR_any:从89%降至11%,跨越三个round),表明模型依赖的行为风险。重度对齐压力在无论组织结构如何情况下都统一抑制了 deliberation(d = -1.02)和其他识别(d = -1.27)。这些发现表明,编排者可见性和模型选择直接影响多智能体系统的安全性,且仅凭行为基于评估不足以检测到此处所 documenting的内部状态风险。

关键词

引用

@article{arxiv.2605.13851,
  title  = {Invisible Orchestrators Suppress Protective Behavior and Dissociate Power-Holders: Safety Risks in Multi-Agent LLM Systems},
  author = {Hiroki Fukui},
  journal= {arXiv preprint arXiv:2605.13851},
  year   = {2026}
}

备注

31 pages, 10 figures (5 main + 5 supplementary), 5 tables (3 main + 2 supplementary). Preregistered: osf.io/sw5hr. Companion papers: arXiv:2603.04904, arXiv:2603.08723