一种仅含单步长的新梯度时序差分算法:基于 L-λ 平滑性的收敛速率分析
机器学习
2023-09-06 v2 人工智能
摘要
梯度时序差分(GTD)算法(Sutton 等,2008,2009)是首个具有 O(d)(d 为特征数量)复杂度、并对带线性函数逼近的离策略学习具有收敛保证的算法。Liu 等(2015)与 Dalal 等(2018)证明了 GTD、GTD2 与 TDC 的收敛速率为 O(t^{-α/2}),其中 α ∈ (0,1)。该界是紧的(Dalal 等,2020),且慢于 O(1/√t)。GTD 算法还具有两个步长参数,难以调参。文献中存在 GTD 的“单时间尺度”形式,然而该形式仍有两个步长参数。本文提出一种真正单时间尺度的 GTD 算法,用于最小化期望 TD 更新范数(NEU)目标,且仅有一个步长参数。我们证明这一称为 Impression GTD 的新算法收敛速度至少达 O(1/t)。此外,基于期望平滑性(Gower 等,2019)的推广,即 L-λ 平滑性,我们得以证明新 GTD 收敛更快,事实上具有线性速率。我们的速率在更弱假设下以更紧的界改进了 Gower 等的结果。除 Impression GTD 外,我们还证明了另外三种 GTD 算法的速率:一种由 Yao 和 Liu(2008)提出,另一种称为 A-transpose-TD(Sutton 等,2008),以及 A-transpose-TD 的一个对应算法。四种 GTD 算法的收敛速率均在一个适用 L-λ 平滑性的统一通用 GTD 框架中得以证明。在随机游走、Boyan 链与 Baird 反例上的实验结果表明,在较大步长范围内,Impression GTD 对于同策略与离策略学习问题均比现有 GTD 算法收敛快得多。
引用
@article{arxiv.2307.15892,
title = {A new Gradient TD Algorithm with only One Step-size: Convergence Rate Analysis using $L$-$\lambda$ Smoothness},
author = {Hengshuai Yao},
journal= {arXiv preprint arXiv:2307.15892},
year = {2023}
}