双时间尺度强化学习的最紧有限时间界分析
机器学习
2019-12-05 v2 概率论
摘要
强化学习中的策略评估常采用双时间尺度随机逼近,由此衍生出多种梯度时序差分方法,如 GTD(0)、GTD2 和 TDC。本文为这类算法提供了收敛速率界。此类算法具有两个迭代变量 和 ,分别使用两个不同的步长序列 和 进行更新。假设 且 ,其中 ,我们证明,以高概率,这两个迭代变量分别以 和 的速率收敛到其各自的解 和 ;这里 隐藏了对数项。通过可比较的下界,我们证明这些界实际上是紧的。据我们所知,这是首个实现这些速率的有限时间分析。虽然已知两个时间尺度分量会渐近解耦,但我们的结果通过表明这种现象实际上从某个有限时间开始发生,更明确地描绘了这一现象。最后,与现有工作相比,我们的结果适用于更广泛的步长族,包括非平方可和的步长。
引用
@article{arxiv.1911.09157,
title = {A Tale of Two-Timescale Reinforcement Learning with the Tightest Finite-Time Bound},
author = {Gal Dalal and Balazs Szorenyi and Gugan Thoppe},
journal= {arXiv preprint arXiv:1911.09157},
year = {2019}
}