中文

重新审视Best-of-N在推理时对齐中的(次)优性

机器学习 2026-03-09 v1 人工智能

摘要

Best-of-N (BoN)采样是一种广泛使用的语言模型推理时对齐方法,其中从参考模型中采样N个候选响应,并根据学习到的奖励模型选择预测奖励最高的一个。尽管其在实际中广泛使用,但最近的理论工作表明它在统计上是次优的,并且容易受到奖励破解的影响,即模型利用学习到的奖励模型的弱点来获得高估计奖励,而并未真正提升性能。我们在比先前工作更贴近实践的假设下重新审视了这个问题。特别地,与早期关注期望真实奖励(在许多实际场景中可能没有意义)的分析不同,我们研究了推理时对齐如何影响胜率——一种与奖励模型在实际中训练和评估方式更一致的基于成对比较的指标。我们证明,在对参考模型和学习到的奖励模型的质量施加最小条件的情况下,适当调整的BoN在计算上和统计上都能达到高胜率的最优性,这在一定程度上解释了其广泛的实际成功。由于BoN在此设置中仍然容易受到奖励破解的影响,我们提出了一种简单且实用的变体,该变体在保持最优统计性能的同时可证明地消除了奖励破解。最后,我们表明,在考虑胜率时,先前的方法被证明是次优的,这凸显了在分析推理时对齐方法时选择适当目标的重要性。

关键词

引用

@article{arxiv.2603.05739,
  title  = {Revisiting the (Sub)Optimality of Best-of-N for Inference-Time Alignment},
  author = {Ved Sriraman and Adam Block},
  journal= {arXiv preprint arXiv:2603.05739},
  year   = {2026}
}

备注

52 pages