中文

超越最强大语言模型:多轮多智能体编排与单 LLM 在基准测试上的对比

人工智能 2025-10-03 v2

摘要

我们研究了多轮多智能体编排,其中多个大语言模型(LLM)智能体通过多轮迭代地提出答案或投票来达成共识。我们使用四种 LLM(Gemini 2.5 Pro、GPT-5、Grok 4 和 Claude Sonnet 4)在 GPQA-Diamond、IFEval 和 MuSR 上进行了两项实验:(i)将编排与单 LLM 基线进行基准对比;(ii)在 GPQA-Diamond 上进行消融实验,变化智能体是否能看到谁撰写了答案以及他们是否能观察到正在进行的投票。编排匹配或超越了最强的单模型,并始终优于其他模型。对最佳可达编排性能的分析显示了进一步提升的潜力。消融实验表明,揭示作者身份会增加自我投票和平局,而展示正在进行的投票会放大羊群效应,从而加速收敛,但有时可能导致过早共识。

关键词

引用

@article{arxiv.2509.23537,
  title  = {Beyond the Strongest LLM: Multi-Turn Multi-Agent Orchestration vs. Single LLMs on Benchmarks},
  author = {Aaron Xuxiang Tian and Ruofan Zhang and Jiayao Tang and Young Min Cho and Xueqian Li and Qiang Yi and Ji Wang and Zhunping Zhang and Danrui Qi and Zekun Li and Xingyu Xiang and Sharath Chandra Guntuku and Lyle Ungar and Tianyu Shi and Chi Wang},
  journal= {arXiv preprint arXiv:2509.23537},
  year   = {2025}
}

备注

9 pages, 3 tables, 1 figure