警惕熵:从最大熵到轨迹熵约束强化学习
机器学习
2025-11-18 v1 人工智能
机器学习
摘要
最大熵已成为无关策略强化学习 (RL) 框架中的主流方法,用于平衡开发与探索。然而,仍存在两个瓶颈限制进一步的性能提升:(1) 由于同时注入熵并更新其加权参数(即温度),导致 Q 值估计非平稳;(2) 短视的局部熵调谐仅根据当前单步熵调整温度,而不考虑累积熵随时间的影响。本文通过提出轨迹熵约束强化学习 (TECRL) 框架来应对这两个挑战。在该框架中,我们首先分别学习两个 Q 函数,一个关联奖励,另一个关联熵,确保受温度更新影响不大的干净稳定的价值目标。然后,专门的熵 Q 函数显式量化预期累积熵,从而实现轨迹熵约束并控制策略的长期随机性。基于 TECRL 框架,我们通过扩展最先进的分布式软演员-评论家算法并引入三个改进 (DSAC-T),开发了实用的无关策略算法 DSAC-E。在 OpenAI Gym 框架上的实验结果表明,DSAC-E 能实现更高的回报和更好的稳定性。
引用
@article{arxiv.2511.11592,
title = {Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL},
author = {Guojian Zhan and Likun Wang and Pengcheng Wang and Feihong Zhang and Jingliang Duan and Masayoshi Tomizuka and Shengbo Eben Li},
journal= {arXiv preprint arXiv:2511.11592},
year = {2025}
}
备注
17 pages