中文

面向测试时强化学习的分布感知奖励估计

计算与语言 2026-01-30 v1

摘要

测试时强化学习(TTRL)使大型语言模型(LLM)能够在无标签输入上自我改进,但其有效性严重依赖于在无真实反馈信号的情况下如何估计奖励。大多数现有 TTRL 方法依赖于对 rollout 进行多数投票(MV)以产生确定性奖励,隐含假设多数 rollout 提供可靠的学习信号。我们展示了这一假设脆弱:MV 将 rollout 分布压缩为单个结果,丢弃了非多数但正确的动作候选者的信息,并产生系统性偏差的奖励估计。为此,我们提出分布感知奖励估计(DARE),其将奖励估计从单个多数结果转向完整的经验 rollout 分布。DARE 进一步通过探索奖励和分布修剪机制,对非多数 rollout 进行探索和奖励去噪,实现更具信息性和鲁棒性的奖励估计。大量实验表明,DARE 在挑战性推理基准上显著提升了优化稳定性和最终性能,在挑战性的 AIME 2024 上实现约 25.3% 的相对提升,在 AMC 上实现约 5.3% 的相对提升。

关键词

引用

@article{arxiv.2601.21804,
  title  = {Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning},
  author = {Bodong Du and Xuanqi Huang and Xiaomeng Li},
  journal= {arXiv preprint arXiv:2601.21804},
  year   = {2026}
}