中文

Best-of-∞ —— 大语言模型测试时集成的渐近性能

机器学习 2026-03-05 v3 人工智能 机器学习

摘要

我们研究基于多数投票进行的 large language model (大语言模型) 的 best-of-N 方法。具体分析其在 N → ∞ 极限情况下的表现,称为 \boinflower。虽然该方法在极限下能取得惊人的性能,但需要无限的测试时预算。为此,我们提出一种自适应生成方案,根据答案一致性选择 N,从而高效分配推理时计算资源。除自适应性外,我们将框架扩展到多个大语言模型的加权集成,证明此类混合模型可超越任何单个模型。最优集成权重被形式化为混合整数线性规划问题,并被高效求解。大量实验表明,我们方法的有效性。

关键词

引用

@article{arxiv.2509.21091,
  title  = {Best-of-$\infty$ -- Asymptotic Performance of Test-Time LLM Ensembling},
  author = {Junpei Komiyama and Daisuke Oba and Masafumi Oyamada},
  journal= {arXiv preprint arXiv:2509.21091},
  year   = {2026}
}

备注

To appear at ICLR2026. Our code is available at https://github.com/jkomiyama/BoInf-code-publish/. Updated the title