Best-of-Majority:Pass@$k$ 推理扩缩的最优策略
机器学习
2025-10-06 v1 机器学习
摘要
LLM 推理通常会为给定提示生成一批候选答案,并通过多数投票或 Best-of-N(BoN)等策略选择其中一个。对于困难任务,这种单次选择往往表现不佳。因此,评估常报告 Pass@:代理可提交最多 个响应,仅使用其中最佳一个来计算 regret。为此,我们研究了更一般的 Pass@ 推理设置,证明了多数投票和 BoN 都不存在随 和抽样预算 的理想扩展性。我们提出一种新的推理策略 Best-of-Majority(BoM),关键步骤是限制候选答案为在 个样本中高频出现的响应,再选择前 个奖励。我们证明,当抽样预算为 时,BoM 的 regret 为 ,其中 为覆盖系数, 为奖励模型的估计误差, 为 optimal response 奖励的估计误差。我们进一步建立了匹配的下界,证明该算法是 minimax 最优的。除了最优性,BoM 还有一项关键优势:与多数投票和 BoN 不同,性能随增大 不会下降。实验结果表明,在数学问题上的推理中,BoM 在两种方法都上都显著优于。
引用
@article{arxiv.2510.03199,
title = {Best-of-Majority: Minimax-Optimal Strategy for Pass@$k$ Inference Scaling},
author = {Qiwei Di and Kaixuan Ji and Xuheng Li and Heyang Zhao and Quanquan Gu},
journal= {arXiv preprint arXiv:2510.03199},
year = {2025}
}
备注
29 pages, 3 figures