马尔可夫采样下 Adam 型强化学习算法的非渐近收敛性
机器学习
2020-08-18 v2 最优化与控制
机器学习
摘要
尽管 Adam 在强化学习 (RL) 中被广泛应用,但 Adam 型 RL 算法的理论收敛性尚未确立。本文首次针对融合 AMSGrad 更新(理论分析中 Adam 的标准替代)的两种基础 RL 算法——策略梯度 (PG) 和时序差分 (TD) 学习,给出了此类收敛分析,分别称为 PG-AMSGrad 和 TD-AMSGrad。此外,我们的分析关注两种算法下的马尔可夫采样。我们证明,在一般非线性函数逼近下,采用常数步长的 PG-AMSGrad 以 的速率(其中 表示迭代次数)收敛到驻点邻域,而采用递减步长则以 的速率精确收敛到驻点。进一步,在线性函数逼近下,采用常数步长的 TD-AMSGrad 以 的速率收敛到全局最优解邻域,而采用递减步长则以 的速率精确收敛到全局最优解。我们的研究发展了用于分析马尔可夫采样下 Adam 型 RL 算法的全新技巧。
引用
@article{arxiv.2002.06286,
title = {Non-asymptotic Convergence of Adam-type Reinforcement Learning Algorithms under Markovian Sampling},
author = {Huaqing Xiong and Tengyu Xu and Yingbin Liang and Wei Zhang},
journal= {arXiv preprint arXiv:2002.06286},
year = {2020}
}