停止高估多智能体辩论 —— 我们必须重新思考评估并拥抱模型异构性
计算与语言
2025-06-24 v3 机器学习
摘要
多智能体辩论 (MAD) 作为一种旨在提高大型语言模型 (LLM) 事实准确性和推理能力的研究方法,正受到广泛关注。尽管其概念具有吸引力,但当前 MAD 研究在评估实践方面存在严重局限,包括基准覆盖范围有限、基线比较薄弱和设置不一致。本文对 5 个代表性 MAD 方法在 9 个基准上使用 4 个基础模型进行系统评估。意外地,我们发现 MAD 往往未能超过简单的单智能体基线方法,如链式思考 (Chain-of-Thought) 和自我一致性 (Self-Consistency),即便其推理时间计算量显著更高。为推进 MAD 研究,我们进一步探讨了模型异构性的作用,发现其是持续改进当前 MAD 框架的通用解药。基于我们的发现,我们认为该领域必须停止高估当前形式的 MAD;要实现真正的进步,必须重新思考评估范式,并积极拥抱模型异构性作为核心设计原则。
引用
@article{arxiv.2502.08788,
title = {Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity},
author = {Hangfan Zhang and Zhiyao Cui and Jianhao Chen and Xinrun Wang and Qiaosheng Zhang and Zhen Wang and Dinghao Wu and Shuyue Hu},
journal= {arXiv preprint arXiv:2502.08788},
year = {2025}
}
备注
This position paper takes a critical view of the status quo of MAD research, and outline multiple potential directions to improve MAD