中文

用于有偏随机逼近有限时间分析的多步 Lyapunov 方法

机器学习 2020-09-02 v3 机器学习 系统与控制 系统与控制 最优化与控制

摘要

受时序差分(TD-)和 Q-learning 算法在强化学习中广泛使用的推动,本文研究了一类有偏随机逼近(SA)过程,其对底层随机噪声序列施加温和的“类遍历”假设。基于一个精心设计的多步 Lyapunov 函数,该函数前瞻若干未来更新以适应随机扰动(用于控制梯度偏差),我们证明了关于迭代收敛的一般性结果,并借此推导了在常步长情况下均方误差的非渐近界。这一新颖的前瞻视角使得在大类随机扰动下对有偏 SA 算法进行有限时间分析成为可能。为与现有成果直接比较,我们还将上述界应用于具有线性函数逼近的 TD- 和 Q-learning,在实用的马尔可夫链观测模型下进行了演示。所得 TD- 与 Q-learning 算法的有限时间误差界属首例:它 i) 对未修改版本(即不对参数更新作任何修改)甚至使用非线性函数逼近器均成立;且对马尔可夫链 ii) 在一般混合条件下以及 iii) 从任意初始分布出发均成立,而现有结果至少须违背其中之一方可适用。

关键词

引用

@article{arxiv.1909.04299,
  title  = {A Multistep Lyapunov Approach for Finite-Time Analysis of Biased Stochastic Approximation},
  author = {Gang Wang and Bingcong Li and Georgios B. Giannakis},
  journal= {arXiv preprint arXiv:1909.04299},
  year   = {2020}
}

备注

28 Pages