推理语言模型强化学习的熵机制
机器学习
2025-05-29 v1 人工智能
计算与语言
摘要
本文旨在克服利用 LLM 进行推理时扩展强化学习(RL)的一大障碍,即策略熵的坍缩。在没有熵干预的大规模 RL 运行中,普遍观察到了这一现象:策略熵在训练早期急剧下降,这种探索能力的削弱总是伴随着策略性能的饱和。在实践中,我们建立了熵 H 与下游性能 R 之间的变换方程 R=-a*e^H+b。这一经验法则有力地表明,策略性能是以策略熵为代价换取的,因此受限于其耗尽程度,且其性能上限是完全可预测的,即 H=0, R=-a+b。我们的发现表明,为了在扩展 RL 计算时持续进行探索,必须进行熵管理。为此,我们从理论和经验上研究了熵动力学。我们的推导表明,策略熵的变化由动作概率与 logits 变化之间的协方差驱动,而在使用类似策略梯度算法时,该协方差与其优势值成正比。实证研究表明,协方差项的值与熵差完全吻合,支持了理论结论。此外,协方差项在整个训练过程中基本保持为正,进一步解释了为何策略熵会单调递减。通过理解熵动力学背后的机制,我们提出通过限制高协方差 token 的更新来控制熵。具体而言,我们提出了两种简单而有效的技术,即 Clip-Cov 和 KL-Cov,分别对高协方差的 token 进行裁剪和施加 KL 惩罚。实验表明,这些方法鼓励了探索,从而帮助策略逃离熵坍缩并取得更好的下游性能。
引用
@article{arxiv.2505.22617,
title = {The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models},
author = {Ganqu Cui and Yuchen Zhang and Jiacheng Chen and Lifan Yuan and Zhi Wang and Yuxin Zuo and Haozhan Li and Yuchen Fan and Huayu Chen and Weize Chen and Zhiyuan Liu and Hao Peng and Lei Bai and Wanli Ouyang and Yu Cheng and Bowen Zhou and Ning Ding},
journal= {arXiv preprint arXiv:2505.22617},
year = {2025}
}