中文

揭秘多智能体辩论:置信度与多样性的作用

计算与语言 2026-01-29 v1 人工智能

摘要

多智能体辩论被广泛用于通过测试时扩展来提升大型语言模型的性能,然而最近的研究表明,尽管计算成本更高,但原始的MAD通常表现不如简单的多数投票。研究表明,在同质智能体和统一信念更新的情况下,辩论保持了预期的正确性,因此无法可靠地改善结果。借鉴人类审议和集体决策的研究成果,我们识别出原始MAD缺失的两个关键机制:(i) 初始观点的多样性,以及 (ii) 明确、校准的置信度沟通。我们提出了两种轻量级干预措施。首先,一种多样性感知的初始化,选择更多样化的候选答案池,增加了在辩论开始时存在正确假设的可能性。其次,一种置信度调节的辩论协议,其中智能体表达校准后的置信度,并根据他人的置信度调节其更新。我们从理论上证明,多样性感知的初始化在不改变底层更新动态的情况下提高了MAD成功的先验概率,而置信度调节的更新使辩论能够系统地漂移到正确的假设。在六个面向推理的问答基准上,我们的方法始终优于原始的MAD和多数投票。我们的结果将人类审议与基于LLM的辩论联系起来,并表明简单、有原则的修改可以显著提高辩论的有效性。

关键词

引用

@article{arxiv.2601.19921,
  title  = {Demystifying Multi-Agent Debate: The Role of Confidence and Diversity},
  author = {Xiaochen Zhu and Caiqi Zhang and Yizhou Chi and Tom Stafford and Nigel Collier and Andreas Vlachos},
  journal= {arXiv preprint arXiv:2601.19921},
  year   = {2026}
}