LLM 与 PRM 信号的最优聚合:高效测试时扩展
计算与语言
2026-04-24 v2
摘要
过程奖赏模型(PRMs)是测试时扩展(TTS)的基石,旨在验证和选择来自大型语言模型(LLMs)的最佳响应。然而,这一承诺面临最近基准的挑战,其中简单的多数投票(忽略 PRM 信号)有时会超过标准的 PRM-based 选择。这引发了一个关键问题:如何有效地利用 PRM 的验证信号进行 TTS?为此,我们首先发展了一个理论框架,用于最佳组合来自 LLM 和 PRM 的信号。我们的框架揭示了最佳策略是对响应进行加权聚合,这一策略的有效性取决于估计捕捉两种模型之间复杂相互作用的权重。基于我们的理论结果,我们实证表明,这些最优权重函数在不同的 LLM-PRM 对之间差异很大,尤其是经常为负权重分配相当大的权重。鼓励这些见解,我们提出了高效的预计算方法来校准这些权重函数。广泛的实验在 5 个 LLMs 和 7 个 PRMs 上表明,我们的校准方法显著提升了 TTS 效率,超过了基础加权多数投票方法,仅使用 21.3% 的计算量。最终,我们的工作表明,投资于更智能的聚合策略可能比简单增加测试时计算量更具说服力地带来性能提升。
关键词
引用
@article{arxiv.2510.13918,
title = {Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling},
author = {Peng Kuang and Yanli Wang and Xiaoyu Han and Yaowenqi Liu and Kaidi Xu and Haohan Wang},
journal= {arXiv preprint arXiv:2510.13918},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026