中文

马尔可夫采样下 Adam 型强化学习算法的非渐近收敛性

机器学习 2020-08-18 v2 最优化与控制 机器学习

摘要

尽管 Adam 在强化学习 (RL) 中被广泛应用,但 Adam 型 RL 算法的理论收敛性尚未确立。本文首次针对融合 AMSGrad 更新(理论分析中 Adam 的标准替代)的两种基础 RL 算法——策略梯度 (PG) 和时序差分 (TD) 学习,给出了此类收敛分析,分别称为 PG-AMSGrad 和 TD-AMSGrad。此外,我们的分析关注两种算法下的马尔可夫采样。我们证明,在一般非线性函数逼近下,采用常数步长的 PG-AMSGrad 以 O(1/T)\mathcal{O}(1/T) 的速率(其中 TT 表示迭代次数)收敛到驻点邻域,而采用递减步长则以 O(log2T/T)\mathcal{O}(\log^2 T/\sqrt{T}) 的速率精确收敛到驻点。进一步,在线性函数逼近下,采用常数步长的 TD-AMSGrad 以 O(1/T)\mathcal{O}(1/T) 的速率收敛到全局最优解邻域,而采用递减步长则以 O(logT/T)\mathcal{O}(\log T/\sqrt{T}) 的速率精确收敛到全局最优解。我们的研究发展了用于分析马尔可夫采样下 Adam 型 RL 算法的全新技巧。

关键词

引用

@article{arxiv.2002.06286,
  title  = {Non-asymptotic Convergence of Adam-type Reinforcement Learning Algorithms under Markovian Sampling},
  author = {Huaqing Xiong and Tengyu Xu and Yingbin Liang and Wei Zhang},
  journal= {arXiv preprint arXiv:2002.06286},
  year   = {2020}
}