中文

Best-of-Majority:Pass@$k$ 推理扩缩的最优策略

机器学习 2025-10-06 v1 机器学习

摘要

LLM 推理通常会为给定提示生成一批候选答案,并通过多数投票或 Best-of-N(BoN)等策略选择其中一个。对于困难任务,这种单次选择往往表现不佳。因此,评估常报告 Pass@kk:代理可提交最多 kk 个响应,仅使用其中最佳一个来计算 regret。为此,我们研究了更一般的 Pass@kk 推理设置,证明了多数投票和 BoN 都不存在随 kk 和抽样预算 NN 的理想扩展性。我们提出一种新的推理策略 Best-of-Majority(BoM),关键步骤是限制候选答案为在 NN 个样本中高频出现的响应,再选择前 kk 个奖励。我们证明,当抽样预算为 N=Ω~(C)N=\tilde\Omega(C^*) 时,BoM 的 regret 为 O(ϵopt+ϵRM2C/k)O(\epsilon_{\mathrm{opt}}+\sqrt{\epsilon_{\mathrm{RM}}^2C^*/k}),其中 CC^* 为覆盖系数,ϵRM\epsilon_{\mathrm{RM}} 为奖励模型的估计误差,ϵopt\epsilon_{\mathrm{opt}} 为 optimal response 奖励的估计误差。我们进一步建立了匹配的下界,证明该算法是 minimax 最优的。除了最优性,BoM 还有一项关键优势:与多数投票和 BoN 不同,性能随增大 NN 不会下降。实验结果表明,在数学问题上的推理中,BoM 在两种方法都上都显著优于。

关键词

引用

@article{arxiv.2510.03199,
  title  = {Best-of-Majority: Minimax-Optimal Strategy for Pass@$k$ Inference Scaling},
  author = {Qiwei Di and Kaixuan Ji and Xuheng Li and Heyang Zhao and Quanquan Gu},
  journal= {arXiv preprint arXiv:2510.03199},
  year   = {2025}
}

备注

29 pages, 3 figures