中文

共识陷阱:通过 Token 级协作拯救受对抗多数派控制的多智能体 LLM

计算与语言 2026-04-21 v1 人工智能 多智能体系统

摘要

多智能体大语言模型 (LLM) 架构日益依赖于基于响应级别的聚合,如多数投票 (MAJ),以提升推理上限。然而,在开放环境中,代理进程于隐蔽的上下文腐化(如针对性提示注入)而极易受到影响。我们揭示了当前多智能体系统中的一个关键结构性漏洞:当被篡改代理构成局部多数时,响应级别的聚合会失效。由于投票聚合的是完整的结论,它对 flawed 中间逻辑毫无察觉。为克服这一系统性限制,我们提出了基于 Token 级轮询 (RR) 协作机制,即代理在共享的自回归上下文中顺序交叉生成。我们将这一过程形式化为离散时间动力系统,证明了 Token 级交叉生成将聚合从脆弱的投票计数(线性求和)转变为动态、交织的逻辑链(非线性算子积)。通过这一理论视角,我们证明即便被篡改代理构成多数,诚实模型的恢复性拉力仍能压倒对抗性腐化。我们进行了详尽的实证评估,跨越多样化推理基准,结果显示尽管 MAJ 在被篡改代理达到多数时会失效,RR 仍能在超过此临界阈值的位置保持稳健的准确性。

关键词

引用

@article{arxiv.2604.17139,
  title  = {The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration},
  author = {Jiayuan Liu and Shiyi Du and Weihua Du and Mingyu Guo and Vincent Conitzer},
  journal= {arXiv preprint arXiv:2604.17139},
  year   = {2026}
}