中文

推理时优化中的最优停止与 Best-of-$N$ 之比较

机器学习 2025-10-03 v1 计算与语言

摘要

大型语言模型(LLM)生成通常需要在输出质量与推理成本之间取得平衡,在使用多次生成时尤为如此。我们引入了一个基于经典潘多拉魔盒问题(Pandora's Box problem)的推理时优化新框架。将每次生成视为打开一个具有随机奖励且需付出成本的“盒子”,我们开发了在不知道潜在奖励分布的情况下决定何时停止生成的算法。我们的首个贡献是一种 UCB 风格的潘多拉魔盒算法,其性能被证明接近于 Weitzman 算法(已知分布下的最优策略)。我们进一步通过受 Bradley-Terry 启发的变换来解决跨提示词的奖励缩放问题,从而将该方法适配到实际的 LLM 设置中。这产生了一种自适应的推理时优化方法,能够对奖励进行归一化并实时学习停止阈值。在 AlpacaFarm 和 HH-RLHF 数据集上,使用多对 LLM 与奖励模型进行的实验表明,我们的自适应策略能够获得与非自适应 Best-of-N 采样相同的性能,同时平均减少 15% 至 35% 的生成次数。我们的结果在最优停止理论与推理时缩放之间建立了一座有原则的桥梁,为 LLM 部署提供了理论性能界限与实际效率提升。

关键词

引用

@article{arxiv.2510.01394,
  title  = {Optimal Stopping vs Best-of-$N$ for Inference Time Optimization},
  author = {Yusuf Kalayci and Vinod Raman and Shaddin Dughmi},
  journal= {arXiv preprint arXiv:2510.01394},
  year   = {2025}
}

备注

24 pages