中文

GRAC:自引导与自正则化的 Actor-Critic

机器学习 2020-11-12 v2 人工智能 机器人学 系统与控制 系统与控制 机器学习

摘要

深度强化学习(DRL)算法已成功展示于一系列具有挑战性的决策与控制任务。近期深度强化学习算法的一个主导组件是目标网络,它缓解了学习 Q 函数时的发散。然而,由于函数更新的延迟,目标网络会拖慢学习过程。我们在本工作中的主要贡献是一种自正则化 TD-学习方法来解决发散问题而无需目标网络。此外,我们提出一种自引导策略改进方法,将策略梯度与零阶优化结合,以在较广邻域内搜索关联更高 Q-值的动作。这使学习对 Q 函数近似中的局部噪声更鲁棒,并引导我们 actor 网络的更新。这些组件共同定义了 GRAC,一种新颖的自引导与自正则化 actor-critic 算法。我们在 OpenAI gym 任务套件上评估 GRAC,在所测试的每一个环境中均达到或超越当前最优(state of the art)。

关键词

引用

@article{arxiv.2009.08973,
  title  = {GRAC: Self-Guided and Self-Regularized Actor-Critic},
  author = {Lin Shao and Yifan You and Mengyuan Yan and Qingyun Sun and Jeannette Bohg},
  journal= {arXiv preprint arXiv:2009.08973},
  year   = {2020}
}