近端梯度 TD 算法的有限样本分析
机器学习
2020-07-06 v2 机器学习
摘要
本文分析了梯度时序差分学习(GTD)系列算法的收敛速率。该类算法的先前分析使用常微分方程技术证明渐近收敛,据我们所知,尚未有有限样本分析。此外,关于收敛的离策略强化学习算法的有限样本分析工作也不多。本文将 GTD 方法表述为关于原对偶鞍点目标函数的随机梯度算法,随后进行鞍点误差分析以获得其性能的有限样本界。还提出了两种改进算法,即投影 GTD2 和 GTD2-MP,分别提供了改进的收敛保证和加速。我们的理论分析结果表明,GTD 系列算法在离策略学习场景中确实可与现有的 LSTD 方法相媲美。
引用
@article{arxiv.2006.14364,
title = {Finite-Sample Analysis of Proximal Gradient TD Algorithms},
author = {Bo Liu and Ji Liu and Mohammad Ghavamzadeh and Sridhar Mahadevan and Marek Petrik},
journal= {arXiv preprint arXiv:2006.14364},
year = {2020}
}
备注
31st Conference on Uncertainty in Artificial Intelligence (UAI). arXiv admin note: substantial text overlap with arXiv:2006.03976