随机变分不等式的简单最优方法,II:马尔可夫噪声与强化学习中的策略评估
最优化与控制
2021-08-17 v4 人工智能
机器学习
摘要
本文关注马尔可夫噪声下的随机变分不等式(VI)。我们算法发展的一个突出应用是强化学习中的随机策略评估问题。文献中先前的探究聚焦于时序差分(TD)学习,采用受随机次梯度下降启发的非光滑有限时间分析,导致了某些局限。这些局限包括:需分析一种修改的 TD 算法(涉及向先验定义的欧氏球投影)、取得非最优收敛速率,以及无法清晰推导并行实现的有益效果。我们的方法在更广的随机 VI 背景下,尤其针对随机策略评估,弥补了这些缺陷。我们开发了多种简单的 TD 学习类算法,受原始版本启发,在保持其简单性的同时,从非渐近分析视角提供明显优势。我们首先给出标准 TD 算法的改进分析,其可受益于并行实现。随后我们提出条件 TD 算法(CTD)的若干版本,其涉及随机迭代的周期更新,从而降低偏差并展现出改进的迭代复杂度。这引导我们得到快速 TD(FTD)算法,其结合了 CTD 与姊妹论文中随机算子外推法的要素。对于一种新颖的索引重置策略,FTD 展现出已知最优收敛速率。我们还设计了一种鲁棒版本算法,特别适用于接近 1 的折扣因子。
引用
@article{arxiv.2011.08434,
title = {Simple and optimal methods for stochastic variational inequalities, II: Markovian noise and policy evaluation in reinforcement learning},
author = {Georgios Kotsalis and Guanghui Lan and Tianjiao Li},
journal= {arXiv preprint arXiv:2011.08434},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2011.02987