Best-of-∞ —— 大语言模型测试时集成的渐近性能
机器学习
2026-03-05 v3 人工智能
机器学习
摘要
我们研究基于多数投票进行的 large language model (大语言模型) 的 best-of-N 方法。具体分析其在 N → ∞ 极限情况下的表现,称为 \boinflower。虽然该方法在极限下能取得惊人的性能,但需要无限的测试时预算。为此,我们提出一种自适应生成方案,根据答案一致性选择 N,从而高效分配推理时计算资源。除自适应性外,我们将框架扩展到多个大语言模型的加权集成,证明此类混合模型可超越任何单个模型。最优集成权重被形式化为混合整数线性规划问题,并被高效求解。大量实验表明,我们方法的有效性。
引用
@article{arxiv.2509.21091,
title = {Best-of-$\infty$ -- Asymptotic Performance of Test-Time LLM Ensembling},
author = {Junpei Komiyama and Daisuke Oba and Masafumi Oyamada},
journal= {arXiv preprint arXiv:2509.21091},
year = {2026}
}
备注
To appear at ICLR2026. Our code is available at https://github.com/jkomiyama/BoInf-code-publish/. Updated the title