中文

最佳者多数:通过自助引导提升最佳-N 方法

机器学习 2025-11-25 v1 人工智能 计算与语言 统计方法学 机器学习

摘要

从大语言模型(LLM)生成多个输出并选择最频繁出现的(自洽)或得分最高的(最佳-N,Best-of-N)候选者是一种流行的方法,用于在离散最终答案任务中实现更高准确率。最佳-N(BoN)选择得分最高的输出,在理想奖励下常能实现接近完美的准确率。然而,在来自奖励模型的不完美奖励下,BoN 难以可靠地找到正确答案,其性能会大幅下降。我们考察了 BoN 输出的分布,指出尽管正确答案在不完美奖励下通常不接近概率 1,但它往往是最可能的结论。这表明该分布的众数(mode)比从中抽样的结果更可靠。基于此思想,我们提出了多数最佳者(Majority-of-the-Bests,MoB),一种新型选择机制,通过自助引导估计 BoN 的输出分布,并选择其众数。实验结果在五个基准测试、三个不同的基础 LLM 和两个奖励模型上显示,在 25 个中的 30 个情形下,MoB 均显著优于 BoN。我们还提供了自助引导一致性的理论结果。MoB 是一种简单而强大的 BoN 和自洽性替代方案,更广泛地激发了在更细致的选择机制方面的进一步研究。

关键词

引用

@article{arxiv.2511.18630,
  title  = {Majority of the Bests: Improving Best-of-N via Bootstrapping},
  author = {Amin Rakhsha and Kanika Madan and Tianyu Zhang and Amir-massoud Farahmand and Amir Khasahmadi},
  journal= {arXiv preprint arXiv:2511.18630},
  year   = {2025}
}