让它冷静:可验证型强化学习的探索式退火解码
计算与语言
2025-10-08 v1 机器学习
摘要
基于可验证奖励的强化学习(RLVR)是提高大型语言模型(LLM)推理能力的强大方法,但其成功依赖于有效的探索。在探索策略方面,一个理想的方法必须同时满足两个根本性挑战:既要保持样本质量,又要确保训练稳定性。虽然标准的固定温度采样方法简单直接,但难以平衡这两种需求,因为高温会降低样本质量,低温则限制发现。在本工作中,我们提出一种更简单且更有效的策略——探索式退火解码(EAD),其依据是:探索对早期 token 的影响最为关键,这些 token 定义了序列的语义方向。EAD通过在生成过程中逐步降低采样温度,从而实施“早期探索、后期开发”策略。这种动态计划鼓励在序列开头提供有意义的、高层次的多样性,然后逐步降低温度以保持样本质量,使采样分布紧密贴近目标策略,这对于训练稳定性至关重要。我们展示,EAD是一种轻量级、即插即用的方法,能够显著提高样本效率,在各种RLVR算法和模型规模下均 consistently 优于固定温度采样。我们的工作表明,将探索与序列生成的自然动力学相结合,为改进LLM推理提供了一条稳健的路径。
引用
@article{arxiv.2510.05251,
title = {Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning},
author = {Chenghao Yang and Lin Gui and Chenxiao Yang and Victor Veitch and Lizhu Zhang and Zhuokai Zhao},
journal= {arXiv preprint arXiv:2510.05251},
year = {2025}
}
备注
Codebase: https://github.com/yangalan123/EAD-RLVR