中文

最大熵强化学习的基于计数的温度调度

机器学习 2021-11-30 v1 人工智能

摘要

最大熵强化学习(MaxEnt RL)算法如软 Q 学习(SQL)和软 actor-critic 权衡奖励与策略熵,有潜力提升训练稳定性与鲁棒性。然而,多数 MaxEnt RL 方法使用恒定的权衡系数(温度),与如下直觉相悖:训练早期温度应较高以避免过拟合噪声价值估计,训练后期应降低,因我们愈发信任高价值估计确实带来好奖励。此外,我们对价值估计的置信度是状态相关的,每次用更多证据更新估计时便增加。本文提出一种简单的基于状态的温度调度方法,并为 SQL 实例化为基于计数的软 Q 学习(CBSQL)。我们在玩具域及若干 Atari 2600 域上评估该方法并展示 promising 结果。

关键词

引用

@article{arxiv.2111.14204,
  title  = {Count-Based Temperature Scheduling for Maximum Entropy Reinforcement Learning},
  author = {Dailin Hu and Pieter Abbeel and Roy Fox},
  journal= {arXiv preprint arXiv:2111.14204},
  year   = {2021}
}