中文

用于深度强化学习的阻尼 Anderson 混合:加速、收敛与稳定

机器学习 2021-10-22 v2 最优化与控制

摘要

Anderson 混合已被启发式地应用于强化学习 (RL) 算法中,以加速深度 RL 的收敛并提高采样效率。尽管 Anderson 混合对收敛有启发式的改进,但尚未对其在 RL 中的优势提出严格的数学证明。在本文中,我们对基于 Anderson 混合构建的一类加速方案提供了更深刻的见解,这些方案能改进深度 RL 算法的收敛。我们的主要结果建立了 Anderson 混合与拟牛顿法之间的联系,并证明了 Anderson 混合通过一个额外的收缩因子增大了策略迭代方案的收敛半径。分析的关键焦点根植于 RL 的不动点迭代性质。我们进一步提出了一种稳定化策略,通过在 Anderson 混合中引入稳定的正则化项以及一个可微的非膨胀 MellowMax 算子,从而可以实现更快的收敛和更稳定的行为。大量实验表明,我们提出的方法增强了 RL 算法的收敛性、稳定性和性能。

关键词

引用

@article{arxiv.2110.08896,
  title  = {Damped Anderson Mixing for Deep Reinforcement Learning: Acceleration, Convergence, and Stabilization},
  author = {Ke Sun and Yafei Wang and Yi Liu and Yingnan Zhao and Bo Pan and Shangling Jui and Bei Jiang and Linglong Kong},
  journal= {arXiv preprint arXiv:2110.08896},
  year   = {2021}
}