GRAC:自引导与自正则化的 Actor-Critic
机器学习
2020-11-12 v2 人工智能
机器人学
系统与控制
系统与控制
机器学习
摘要
深度强化学习(DRL)算法已成功展示于一系列具有挑战性的决策与控制任务。近期深度强化学习算法的一个主导组件是目标网络,它缓解了学习 Q 函数时的发散。然而,由于函数更新的延迟,目标网络会拖慢学习过程。我们在本工作中的主要贡献是一种自正则化 TD-学习方法来解决发散问题而无需目标网络。此外,我们提出一种自引导策略改进方法,将策略梯度与零阶优化结合,以在较广邻域内搜索关联更高 Q-值的动作。这使学习对 Q 函数近似中的局部噪声更鲁棒,并引导我们 actor 网络的更新。这些组件共同定义了 GRAC,一种新颖的自引导与自正则化 actor-critic 算法。我们在 OpenAI gym 任务套件上评估 GRAC,在所测试的每一个环境中均达到或超越当前最优(state of the art)。
引用
@article{arxiv.2009.08973,
title = {GRAC: Self-Guided and Self-Regularized Actor-Critic},
author = {Lin Shao and Yifan You and Mengyuan Yan and Qingyun Sun and Jeannette Bohg},
journal= {arXiv preprint arXiv:2009.08973},
year = {2020}
}