中文

近端梯度 TD 算法的有限样本分析

机器学习 2020-07-06 v2 机器学习

摘要

本文分析了梯度时序差分学习(GTD)系列算法的收敛速率。该类算法的先前分析使用常微分方程技术证明渐近收敛,据我们所知,尚未有有限样本分析。此外,关于收敛的离策略强化学习算法的有限样本分析工作也不多。本文将 GTD 方法表述为关于原对偶鞍点目标函数的随机梯度算法,随后进行鞍点误差分析以获得其性能的有限样本界。还提出了两种改进算法,即投影 GTD2 和 GTD2-MP,分别提供了改进的收敛保证和加速。我们的理论分析结果表明,GTD 系列算法在离策略学习场景中确实可与现有的 LSTD 方法相媲美。

关键词

引用

@article{arxiv.2006.14364,
  title  = {Finite-Sample Analysis of Proximal Gradient TD Algorithms},
  author = {Bo Liu and Ji Liu and Mohammad Ghavamzadeh and Sridhar Mahadevan and Marek Petrik},
  journal= {arXiv preprint arXiv:2006.14364},
  year   = {2020}
}

备注

31st Conference on Uncertainty in Artificial Intelligence (UAI). arXiv admin note: substantial text overlap with arXiv:2006.03976