中文

(近似)奖励模型在推理时间扩展中的作用

计算与语言 2026-02-03 v1 机器学习

摘要

推理时间扩展 (inference-time scaling) 最近成为提高大型语言模型推理能力的强大范式。在各种方法中,Sequential Monte Carlo (SMC) 已成为特别重要的框架,支持迭代生成、评估、拒绝和重抽取中间推理轨迹。其核心组件是奖励模型,用于评估部分解并指导计算在推理期间的分配。然而,实际中永远不存在真正的奖励模型。所有部署系统都依赖近似奖励模型,这引出一个根本性问题:近似奖励模型为何及何时足以实现有效的推理时间扩展?本工作提供了一个理论答案。我们识别了近似奖励模型的 Bellman 误差作为 SMC 基于推理时间扩展有效性的关键量。对于长度为 TT 的推理过程,我们展示,如果近似奖励模型的 Bellman 误差受到 O(1/T)O(1/T) 的界,则将该奖励模型与 SMC 结合可将推理的计算复杂度从指数级降低为 TT 的多项式级。这尽管仅使用近似奖励,仍实现了推理效率的指数级提升。

关键词

引用

@article{arxiv.2602.01381,
  title  = {On the Power of (Approximate) Reward Models for Inference-Time Scaling},
  author = {Youheng Zhu and Yiping Lu},
  journal= {arXiv preprint arXiv:2602.01381},
  year   = {2026}
}