中文

通过自举协变量偏移进行离策略深度强化学习

机器学习 2019-01-29 v1 机器学习

摘要

在本文中,我们重新审视由 Hallak 等人(2017)开创的强化学习离策略修正方法(COP-TD)。在该方法下,对值函数的在线更新进行重新加权,以避免离策略学习典型的发散问题。尽管 Hallak 等人的解决方案颇具吸引力,但它不易迁移到非线性函数近似。首先,它需要在概率单纯形上的投影步骤;其次,即使描述离策略学习算法期望行为的算子是收敛的,也未知其是否为压缩映射,因此在实践中可能更不稳定。我们通过向 COP-TD 引入折扣因子来解决这两个问题。我们分析了折扣 COP-TD 的行为,并从理论角度发现其性质更好。我们还提出了一种替代的软归一化惩罚,可在线上最小化,且免除了显式投影步骤的需要。我们以对 Atari 领域中 Pong 游戏的离策略设置下这两种技术的实证评估补充我们的分析,发现折扣 COP-TD 在实践中比软归一化惩罚表现更好。最后,我们在 Atari 领域的 5 个游戏中进行了折扣 COP-TD 的更广泛评估,发现我们的方法取得了性能提升。

关键词

引用

@article{arxiv.1901.09455,
  title  = {Off-Policy Deep Reinforcement Learning by Bootstrapping the Covariate Shift},
  author = {Carles Gelada and Marc G. Bellemare},
  journal= {arXiv preprint arXiv:1901.09455},
  year   = {2019}
}

备注

AAAI 2019