中文

面向离散 Soft Actor-Critic 的目标熵退火

机器学习 2021-12-07 v1 人工智能

摘要

Soft Actor-Critic (SAC) 被视为连续动作空间设定下的前沿算法。它利用最大熵框架以提升效率与稳定性,并应用一种启发式温度 Lagrange 项来调节温度 α\alpha,该温度决定了策略应有多“软”。令人反直觉的是,经验证据表明 SAC 在离散域中表现不佳。本文探讨该现象的可能解释,并提出目标熵调度 SAC(TES-SAC),一种应用于 SAC 的目标熵参数退火方法。目标熵是温度 Lagrange 项中的常数,代表离散 SAC 中的目标策略熵。我们在 Atari 2600 游戏上将我们的方法与不同常数目标熵 SAC 进行比较,并分析我们的调度如何影响 SAC。

关键词

引用

@article{arxiv.2112.02852,
  title  = {Target Entropy Annealing for Discrete Soft Actor-Critic},
  author = {Yaosheng Xu and Dailin Hu and Litian Liang and Stephen McAleer and Pieter Abbeel and Roy Fox},
  journal= {arXiv preprint arXiv:2112.02852},
  year   = {2021}
}