最大熵强化学习的基于计数的温度调度
机器学习
2021-11-30 v1 人工智能
摘要
最大熵强化学习(MaxEnt RL)算法如软 Q 学习(SQL)和软 actor-critic 权衡奖励与策略熵,有潜力提升训练稳定性与鲁棒性。然而,多数 MaxEnt RL 方法使用恒定的权衡系数(温度),与如下直觉相悖:训练早期温度应较高以避免过拟合噪声价值估计,训练后期应降低,因我们愈发信任高价值估计确实带来好奖励。此外,我们对价值估计的置信度是状态相关的,每次用更多证据更新估计时便增加。本文提出一种简单的基于状态的温度调度方法,并为 SQL 实例化为基于计数的软 Q 学习(CBSQL)。我们在玩具域及若干 Atari 2600 域上评估该方法并展示 promising 结果。
引用
@article{arxiv.2111.14204,
title = {Count-Based Temperature Scheduling for Maximum Entropy Reinforcement Learning},
author = {Dailin Hu and Pieter Abbeel and Roy Fox},
journal= {arXiv preprint arXiv:2111.14204},
year = {2021}
}