关于 LLM-RL 算法中的熵控制
机器学习
2026-02-06 v3 人工智能
摘要
对于强化学习(RL)算法,适当的熵控制对其有效性至关重要。为了控制策略熵,一种常用的方法是熵正则化,它被应用于包括 PPO、SAC 和 A3C 在内的各种流行 RL 算法中。尽管熵正则化在传统的机器人和游戏 RL 中证明是有效的,但研究发现它在 LLM-RL 训练中几乎没有或完全没有增益。在这项工作中,我们研究了 LLM-RL 环境下熵奖励的问题。具体而言,我们首先论证了传统的熵正则化受到 LLM 极大的响应空间和最优输出稀疏性的影响。作为补救措施,我们提出了 AEnt,一种熵控制方法,该方法利用带有自动调整系数的新型截断熵奖励。截断熵是通过在某个更小的 token 空间上定义的重归一化策略来评估的,这鼓励在更紧凑的响应集合内进行探索。此外,该算法根据截断熵值自动调整熵系数,在利用熵的优势的同时有效地控制了熵引起的偏差。AEnt 在不同基础模型和数据集下的数学推理任务中进行了测试,观察到 AEnt 在多个基准上始终优于基线。
引用
@article{arxiv.2509.03493,
title = {On Entropy Control in LLM-RL Algorithms},
author = {Han Shen},
journal= {arXiv preprint arXiv:2509.03493},
year = {2026}
}
备注
Updated with ICLR 2026 version