面向离散 Soft Actor-Critic 的目标熵退火
机器学习
2021-12-07 v1 人工智能
摘要
Soft Actor-Critic (SAC) 被视为连续动作空间设定下的前沿算法。它利用最大熵框架以提升效率与稳定性,并应用一种启发式温度 Lagrange 项来调节温度 ,该温度决定了策略应有多“软”。令人反直觉的是,经验证据表明 SAC 在离散域中表现不佳。本文探讨该现象的可能解释,并提出目标熵调度 SAC(TES-SAC),一种应用于 SAC 的目标熵参数退火方法。目标熵是温度 Lagrange 项中的常数,代表离散 SAC 中的目标策略熵。我们在 Atari 2600 游戏上将我们的方法与不同常数目标熵 SAC 进行比较,并分析我们的调度如何影响 SAC。
引用
@article{arxiv.2112.02852,
title = {Target Entropy Annealing for Discrete Soft Actor-Critic},
author = {Yaosheng Xu and Dailin Hu and Litian Liang and Stephen McAleer and Pieter Abbeel and Roy Fox},
journal= {arXiv preprint arXiv:2112.02852},
year = {2021}
}