中文

大语言模型集Ensemble的智慧与幻觉:代码生成与修复

软件工程 2025-10-31 v2 计算与语言 机器学习

摘要

今天寻求以单一大型语言模型(LMM)解决所有软件工程任务的做法资源密集,忽视了互补性带来的潜在益处——不同模型各自贡献独特优势。然而,编码LLMs之间的互补性程度以及最大化ensemble潜力的最佳策略尚不明确,导致实践者缺乏超越单模型系统的清晰路径。为填补这一空白,我们实证比较了来自五家模型家族的十个独立LLMs以及三个ensemble,这些模型在覆盖代码生成和程序修复的三个软件工程基准测试中进行评估。我们评估模型之间的互补性以及最佳单模型与ensemble之间性能差距。随后,我们评估各种选择启发式方法,从ensemble的候选池中识别正确解。我们发现,ensemble性能的理论上限可比最佳单模型高出83%。我们的结果表明,基于共识的选择策略陷入“流行陷阱”,放大了常见且错误的输出。相反,基于多样性的策略可实现该理论潜力的95%,且在小型两个模型ensemble中同样有效,为利用多个LLMs提升性能提供了成本有效的方法。

关键词

引用

@article{arxiv.2510.21513,
  title  = {Wisdom and Delusion of LLM Ensembles for Code Generation and Repair},
  author = {Fernando Vallecillos-Ruiz and Max Hort and Leon Moonen},
  journal= {arXiv preprint arXiv:2510.21513},
  year   = {2025}
}

备注

Added Acknowledgments section and hyphenated last names