适用于离散动作设置的Soft Actor-Critic算法
机器学习
2019-10-21 v2 人工智能
机器学习
摘要
Soft Actor-Critic是一种用于连续动作设置的最先进的强化学习算法,但不适用于离散动作设置。然而,许多重要的设置涉及离散动作,因此我们在此推导出Soft Actor-Critic算法的一个替代版本,使其适用于离散动作设置。然后我们展示,即使没有任何超参数调整,该算法在Atari套件的一系列游戏上也能与经过调优的、最先进的无模型算法相竞争。
关键词
引用
@article{arxiv.1910.07207,
title = {Soft Actor-Critic for Discrete Action Settings},
author = {Petros Christodoulou},
journal= {arXiv preprint arXiv:1910.07207},
year = {2019}
}