LLM代理是否真的能够辩论?关于多智能体辩论在逻辑推理中的控制性研究
多智能体系统
2025-11-12 v1
摘要
多智能体辩论(MAD)最近作为一种提高大型语言模型(LLM)推理性能的有前景框架而逐渐受到关注。然而,LLM代理是否能够超越简单集成或多数投票,真正参与到深入的推理过程中,仍然不明确。我们通过使用骑士--凡人--间谋逻辑拼图进行受控研究,以实现对辩论结果和过程的精确、逐步评估,并确保可验证的真实答案。我们系统性地设置了六个结构性和认知因素,包括代理团队规模、组成、置信度可见性、辩论顺序、辩论深度和任务难度,以消解这些因素对集体推理的各自影响。我们的结果表明,内在推理强度和团队多样性是辩论成功的主要驱动力,而诸如顺序或置信度可见性等结构参数仅提供有限的提升。除了结果外,过程级分析识别出关键行为模式:多数压力抑制了独立纠错,有效的团队能够推翻错误的共识,而理性且与有效性一致的推理最强地预测了改进。这些发现为理解LLM辩论为何成功或失败提供了宝贵的见解,为设计可解释且以寻求真理为导向的多智能体推理系统提供了指导。
引用
@article{arxiv.2511.07784,
title = {Can LLM Agents Really Debate? A Controlled Study of Multi-Agent Debate in Logical Reasoning},
author = {Haolun Wu and Zhenkun Li and Lingyao Li},
journal= {arXiv preprint arXiv:2511.07784},
year = {2025}
}
备注
20 pages, 6 figures