中文

一种自调节的 Actor-Critic 算法

机器学习 2021-04-15 v5 机器学习

摘要

强化学习算法对超参数的选择高度敏感,通常需要在新领域上投入大量人工努力来寻找表现良好的超参数。在本文中,我们通过使用元梯度以元梯度下降方式在线自动调节超参数(Xu 等,2018),朝解决该问题迈出一步。我们将我们的算法,即自调节 Actor-Critic(STAC),应用于自调节 actor-critic 损失函数的所有可微超参数,以发现辅助任务,并使用一种新颖的 leaky V-trace 算子改进离策略学习。STAC 使用简单、样本高效且不需要显著增加计算量。消融研究表明,随着我们调节更多超参数,STAC 的整体性能得到提升。当应用于 Arcade 学习环境(Bellemare 等,2012)时,STAC 在 200M 步内将中位人类标准化分数从 243% 提高到 364%。当应用于 DM Control 套件(Tassa 等,2018)时,STAC 在 30M 步内将均值分数从使用特征学习时的 217 提高到 389,从像素学习时的 108 提高到 202,并在真实世界强化学习挑战(Dulac-Arnold 等,2020)中从 195 提高到 295。

关键词

引用

@article{arxiv.2002.12928,
  title  = {A Self-Tuning Actor-Critic Algorithm},
  author = {Tom Zahavy and Zhongwen Xu and Vivek Veeriah and Matteo Hessel and Junhyuk Oh and Hado van Hasselt and David Silver and Satinder Singh},
  journal= {arXiv preprint arXiv:2002.12928},
  year   = {2021}
}