中文

通过奖励尾部引导的搜索预测与改进测试时比例扩张

机器学习 2026-02-03 v1 机器学习

摘要

测试时比例扩张已成为增强大型语言模型(LLM)推理能力的关键途径。尽管直观的“从 N 中选最佳”(BoN)策略已显示出显著的性能提升,但缺乏对 NN 选择、预算分配和多阶段决策的原则指导,仍留下了大量优化空间。虽然许多工作探索了此类优化,但严格的理论保证仍有限。本文中,我们提出了新方法,通过尾部引导搜索来预测和改进比例扩张特性。通过估计奖励尾部分布,我们的方法无需进行详尽评估即可预测 LLM 的比例扩张规律。借助此预测工具,我们引入比例扩张引导(SLG)搜索,一种新的测试时算法,动态分配计算资源以识别和利用最高预测潜力的中间状态。我们理论证明,SLG 相对于完美信息或acles 实现零后悔,预期奖励可避免使用 BoN 时所需的多项计算预算。实验上,我们在不同的 LLM 和奖励模型上验证了该框架,确认在相同计算预算下,尾部引导的分配 consistently 实现更高的奖励产出。我们的代码已公开于 https://github.com/PotatoJnny/Scaling-Law-Guided-search。

关键词

引用

@article{arxiv.2602.01485,
  title  = {Predicting and improving test-time scaling laws via reward tail-guided search},
  author = {Muheng Li and Jian Qian and Wenlong Mou},
  journal= {arXiv preprint arXiv:2602.01485},
  year   = {2026}
}

备注

33 pages, 5 figures