重新思考混合代理:混合不同的大型语言模型是否具有益处?
计算与语言
2025-02-04 v1 机器学习
摘要
对来自不同来源的输出进行集合处理是一种直截而当且有效的提升绩效的方法。混合代理(Mixture-of-Agents, MoA)是一种流行的集合方法,通过聚合来自多个不同大型语言模型(LLM)的输出。本文在语言模型语境下提出了一个问题:混合不同的LLM是否真的有益处?我们提出了Self-MoA——一种仅聚合单一最佳LLM输出的集合方法。我们的广泛实验揭示了令人惊讶的结果:Self-MoA在大量场景下超越了标准MoA(即混合不同LLM)。在AlpacaEval 2.0基准测试中,Self-MoA相较于MoA提升6.6%;在包括MMLU、CRUX和MATH在内的多个基准测试中实现平均提升3.8%。将Self-MoA直接应用于AlpacaEval 2.0排名靠前的模型,可在排行榜上实现新的最佳性能。为理解Self-MoA的有效性,我们系统性地研究了在各种MoA设置下多样性与输出质量之间的权衡。我们确认,MoA绩效对输出质量较为敏感,混合不同的LLM往往会降低模型的平均质量。为补充本研究,我们识别了混合不同LLM可能有益的场景。本文进一步引入了Self-MoA的序列版本,能够在多个轮次中对大量LLM输出进行即时聚合,且与一次性聚合所有输出的效果相当。
引用
@article{arxiv.2502.00674,
title = {Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?},
author = {Wenzhe Li and Yong Lin and Mengzhou Xia and Chi Jin},
journal= {arXiv preprint arXiv:2502.00674},
year = {2025}
}