双时间尺度离策略时序差分学习:基于马尔可夫样本的非渐近分析
机器学习
2019-09-27 v1 机器学习
摘要
基于梯度的时间差分(GTD)算法在离策略学习场景中被广泛使用。其中,带梯度校正的双时间尺度时序差分(TDC)算法已被证明具有优越性能。与以往仅在独立同分布(i.i.d.)数据样本下刻画 TDC 非渐近收敛速率的研究不同,我们首次给出了非 i.i.d. 马尔可夫样本路径与线性函数逼近下双时间尺度 TDC 的非渐近收敛分析。我们表明,在递减步长下双时间尺度 TDC 可快至以 O(log t/(t^(2/3))) 收敛,而在恒定步长下可指数级快速收敛,但代价是存在非消失误差。我们进一步提出了一种块递减步长的 TDC 算法,并证明其以块线性收敛速率渐近收敛到任意小误差。我们的实验表明,该算法在恒定步长下与 TDC 收敛得一样快,且在递减步长下仍享有与 TDC 相当的精度。
引用
@article{arxiv.1909.11907,
title = {Two Time-scale Off-Policy TD Learning: Non-asymptotic Analysis over Markovian Samples},
author = {Tengyu Xu and Shaofeng Zou and Yingbin Liang},
journal= {arXiv preprint arXiv:1909.11907},
year = {2019}
}
备注
To appear in NeurIPS 2019