用于异策略深度强化学习的正则化Anderson加速方法
机器学习
2021-12-07 v3 人工智能
机器学习
摘要
无模型深度强化学习(RL)算法已被广泛应用于一系列复杂控制任务。然而,收敛缓慢和样本效率低下仍然是RL中的挑战性问题,尤其是在处理连续和高维状态空间时。为解决这一问题,我们借鉴正则化Anderson加速(RAA)的核心思想,提出了一种适用于无模型、异策略深度RL算法的通用加速方法。RAA是一种加速求解带扰动不动点问题的有效方法。具体而言,我们首先解释了如何将策略迭代与Anderson加速直接结合。然后,我们通过引入一个正则化项来控制函数逼近误差引起的扰动影响,将RAA扩展到深度RL场景。我们进一步提出了两种策略,即渐进式更新和自适应重启,以增强性能。我们的方法在包括Atari 2600和MuJoCo在内的多种基准任务上进行了评估。实验结果表明,我们的方法显著提升了最先进深度RL算法的学习速度和最终性能。
引用
@article{arxiv.1909.03245,
title = {Regularized Anderson Acceleration for Off-Policy Deep Reinforcement Learning},
author = {Wenjie Shi and Shiji Song and Hui Wu and Ya-Chu Hsu and Cheng Wu and Gao Huang},
journal= {arXiv preprint arXiv:1909.03245},
year = {2021}
}
备注
33rd Conference on Neural Information Processing Systems (NeurIPS 2019)