中文

大规模推理模型中强化学习的熵问题重审

计算与语言 2026-04-21 v3 人工智能 机器学习

摘要

基于可验证奖励的强化学习(RLVR)已成为增强大型语言模型(LLMs)推理能力的热门范式。然而,LLM 在 RLVR 训练期间的熵往往会坍缩,导致模型过早地收敛到次优局部最小值,阻碍进一步的性能提升。尽管提出了各种方法来缓解熵坍缩,但关于 RLVR 中熵的综合研究仍缺乏。为填补这一空白,我们进行大量实验,以探讨使用 RLVR 训练的 LLM 的熵动力学,并分析模型熵如何与各种基准测试中的响应多样性、校准和性能相关。我们的结果识别了影响熵的三个关键因素:优化目标中的裁剪阈值、离策略更新的数量以及训练数据的多样性。此外,通过理论分析和经验验证,我们证明了具有正优势的 token 是熵坍缩的主要驱动因素。鼓励这一洞见,我们提出了正优势重加权(Positive-Advantage Reweighting)方法,通过调整 RLVR 训练中具有正优势的 token 所分配的损失权重来调节模型熵,同时保持竞争的性能。

关键词

引用

@article{arxiv.2511.05993,
  title  = {Revisiting Entropy in Reinforcement Learning for Large Reasoning Models},
  author = {Renren Jin and Pengzhi Gao and Yuqi Ren and Zhuowen Han and Tongxuan Zhang and Wuwei Huang and Wei Liu and Jian Luan and Deyi Xiong},
  journal= {arXiv preprint arXiv:2511.05993},
  year   = {2026}
}

备注

ACL 2026 Findings