马尔可夫噪声下线性函数逼近的 Greedy-GQ 有限样本分析
机器学习
2020-05-21 v1 机器学习
摘要
Greedy-GQ 是一种用于强化学习中最优控制的离策略双时间尺度算法。本文针对马尔可夫噪声下采用线性函数逼近的 Greedy-GQ 算法,给出了首个有限样本分析。我们的有限样本分析为该双时间尺度算法在实践中选择步长以实现更快收敛提供了理论依据,并揭示了收敛速率与所得策略质量之间的权衡。本文将双时间尺度强化学习算法的有限样本分析从策略评估扩展到了更具实际意义的最优控制。具体而言,与现有双时间尺度方法(如 GTD、GTD2 和 TDC)的凸目标函数不同,Greedy-GQ 算法的目标函数是非凸的。此外,Greedy-GQ 算法也并非线性双时间尺度随机近似算法。本文的技术为基于价值的非凸强化学习最优控制算法的有限样本分析提供了一个通用框架。
引用
@article{arxiv.2005.10175,
title = {Finite-sample Analysis of Greedy-GQ with Linear Function Approximation under Markovian Noise},
author = {Yue Wang and Shaofeng Zou},
journal= {arXiv preprint arXiv:2005.10175},
year = {2020}
}
备注
UAI 2020