中文

双时间尺度基于值强化学习算法的样本复杂度界

机器学习 2020-11-11 v1 机器学习

摘要

双时间尺度随机逼近(SA)已广泛用于基于值的强化学习算法中。在策略评估设定下,带梯度修正的时间差分学习(TDC)算法的线性和非线性形式可分别建模为线性 SA 和非线性 SA。在策略优化设定下,双时间尺度非线性 SA 亦可建模贪婪梯度-Q(Greedy-GQ)算法。在以往研究中,线性 TDC 与 Greedy-GQ 的有限样本分析已在马尔可夫设定下、以递减或依赖于精度的步长得到研究。对于非线性 TDC 算法,仅建立了渐近收敛性。本文中,我们研究双时间尺度线性与非线性 TDC 及 Greedy-GQ 在马尔可夫采样且采用与精度无关的常数步长下的非渐近收敛速率。对于线性 TDC,我们给出一种新的非渐近分析,并证明在常数步长下其以 O(ϵ1log(1/ϵ))\mathcal{O}(\epsilon^{-1}\log(1/\epsilon)) 的最优样本复杂度达到 ϵ\epsilon-精确解。对于非线性 TDC 与 Greedy-GQ,我们证明两者均以样本复杂度 O(ϵ2)\mathcal{O}(\epsilon^{-2}) 达到 ϵ\epsilon-精确平稳解。这是针对非线性 TDC 在马尔可夫采样下的首个非渐近收敛结果,且我们的 Greedy-GQ 结果相较先前结果在阶上优出 O(ϵ1log(1/ϵ))\mathcal{O}(\epsilon^{-1}\log(1/\epsilon)) 的因子。

关键词

引用

@article{arxiv.2011.05053,
  title  = {Sample Complexity Bounds for Two Timescale Value-based Reinforcement Learning Algorithms},
  author = {Tengyu Xu and Yingbin Liang},
  journal= {arXiv preprint arXiv:2011.05053},
  year   = {2020}
}

备注

Submitted for conference publication