后训练应优化什么?一种测试时比例定律视角
机器学习
2026-05-12 v1 机器学习
摘要
大型语言模型正越来越多地采用测试时策略:采样N个响应,用奖励模型或验证器对其进行评分,然后返回最佳结果。这一部署规则暴露了后训练中的不匹配:标准目标函数优化的是单个响应的平均奖励,而最佳-N性能由奖励分布的上尾部决定。近期的测试时感知目标在一定程度上缓解了这一不匹配,但通常假设训练可以使用与部署相同的每个提示的 rollout 预算,这在后训练必须覆盖大量提示而部署可为每个提示分配更大预算的情况下是不切实际的。我们研究这种预算不匹配的情形,其中在训练时仅可获得m << N的每个提示rollout,但目标是最佳-N部署。在奖励尾部的结构假设下,我们展示,最佳-N目标的策略梯度可以从较小的 rollout 组中通过外推上尾部统计信息来近似。这一结果产生了一系列针对最佳-N导向后训练的Tail-Extrapolated估计器:一种简单直接的估计器,Tail-Extrapolated Advantage(TEA),以及基于矩消除的固定阶数去偏Prefix-TEA估计器。在指令跟随任务上的实验表明,TEA和Prefix-TEA在不同语言模型、奖励模型和数据集下的各种训练和测试时预算设置下,均改进了最佳-N性能。
引用
@article{arxiv.2605.10716,
title = {What should post-training optimize? A test-time scaling law perspective},
author = {Muheng Li and Jian Qian and Wenlong Mou},
journal= {arXiv preprint arXiv:2605.10716},
year = {2026}
}