中文

我们是否应该陷入疯狂?审视大语言模型的多智能体辩论策略

计算与语言 2024-07-19 v3 人工智能

摘要

大语言模型(LLMs)近期的进展凸显了其在多个领域应答查询的潜力。然而,如何确保生成式智能体提供准确可靠的答案仍是一项持续的挑战。在此背景下,多智能体辩论(MAD)已成为提升 LLM 真实性的一种有前景的策略。我们对一系列辩论与提示策略进行基准测试,以探究成本、时间与准确率之间的权衡。重要的是,我们发现当前形式下的多智能体辩论系统并不能可靠地优于其他已提出的提示策略,例如自一致性与使用多条推理路径的集成。然而,在进行超参数调优时,若干 MAD 系统(如多角色(Multi-Persona))表现更优。这表明 MAD 协议可能并非本质上劣于其他方法,而是对不同的超参数设置更为敏感且难以优化。我们基于这些结果提出改进辩论策略的见解,例如调整智能体一致度水平,可显著提升性能甚至超越我们所评估的所有其他非辩论协议。我们向社区提供一个开源仓库,内含若干最先进协议及用于在流行研究数据集上基准测试的评估脚本。

关键词

引用

@article{arxiv.2311.17371,
  title  = {Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs},
  author = {Andries Smit and Paul Duckworth and Nathan Grinsztajn and Thomas D. Barrett and Arnu Pretorius},
  journal= {arXiv preprint arXiv:2311.17371},
  year   = {2024}
}

备注

2 pages, 13 figures