中文

测试时计算的极限:用于更好推理的顺序奖励过滤

机器学习 2025-12-05 v1

摘要

测试时计算(TTC)已成为增强大语言模型(LLMs)的日益突出的范式。尽管best-of-nn(BoN)采样和顺序修正等方法在经验上取得了成功,但它们的基本极限仍不清楚。我们通过分析混合参考策略模型填补了这一空白,并证明标准BoN本质上次优。为了更接近最优前沿,我们研究了奖励过滤顺序推理,这是一种简单的方法,仅将高奖励生成选择性地纳入上下文。该机制将计算集中于更优的策略候选并抑制较差的候选。在理论上,我们证明奖励过滤顺序推理比标准TTC范式提供了严格更强的保证。在经验上,我们在多样化基准测试上评估了这种推理策略,观察到相对于广泛使用的方法的一致改进,展示了我们框架的实用有效性。

关键词

引用

@article{arxiv.2512.04558,
  title  = {On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference},
  author = {Yue Yu and Qiwei Di and Quanquan Gu and Dongruo Zhou},
  journal= {arXiv preprint arXiv:2512.04558},
  year   = {2025}
}

备注

45 pages, 6 figures, 3 tables