双时间尺度基于值强化学习算法的样本复杂度界
机器学习
2020-11-11 v1 机器学习
摘要
双时间尺度随机逼近(SA)已广泛用于基于值的强化学习算法中。在策略评估设定下,带梯度修正的时间差分学习(TDC)算法的线性和非线性形式可分别建模为线性 SA 和非线性 SA。在策略优化设定下,双时间尺度非线性 SA 亦可建模贪婪梯度-Q(Greedy-GQ)算法。在以往研究中,线性 TDC 与 Greedy-GQ 的有限样本分析已在马尔可夫设定下、以递减或依赖于精度的步长得到研究。对于非线性 TDC 算法,仅建立了渐近收敛性。本文中,我们研究双时间尺度线性与非线性 TDC 及 Greedy-GQ 在马尔可夫采样且采用与精度无关的常数步长下的非渐近收敛速率。对于线性 TDC,我们给出一种新的非渐近分析,并证明在常数步长下其以 的最优样本复杂度达到 -精确解。对于非线性 TDC 与 Greedy-GQ,我们证明两者均以样本复杂度 达到 -精确平稳解。这是针对非线性 TDC 在马尔可夫采样下的首个非渐近收敛结果,且我们的 Greedy-GQ 结果相较先前结果在阶上优出 的因子。
引用
@article{arxiv.2011.05053,
title = {Sample Complexity Bounds for Two Timescale Value-based Reinforcement Learning Algorithms},
author = {Tengyu Xu and Yingbin Liang},
journal= {arXiv preprint arXiv:2011.05053},
year = {2020}
}
备注
Submitted for conference publication