中文

双时间尺度强化学习的最紧有限时间界分析

机器学习 2019-12-05 v2 概率论

摘要

强化学习中的策略评估常采用双时间尺度随机逼近,由此衍生出多种梯度时序差分方法,如 GTD(0)、GTD2 和 TDC。本文为这类算法提供了收敛速率界。此类算法具有两个迭代变量 θn\theta_nwnw_n,分别使用两个不同的步长序列 αn\alpha_nβn\beta_n 进行更新。假设 αn=nα\alpha_n = n^{-\alpha}βn=nβ\beta_n = n^{-\beta},其中 1>α>β>01 > \alpha > \beta > 0,我们证明,以高概率,这两个迭代变量分别以 θnθ=O~(nα/2)\|\theta_n - \theta^*\| = \tilde{O}( n^{-\alpha/2})wnw=O~(nβ/2)\|w_n - w^*\| = \tilde{O}(n^{-\beta/2}) 的速率收敛到其各自的解 θ\theta^*ww^*;这里 O~\tilde{O} 隐藏了对数项。通过可比较的下界,我们证明这些界实际上是紧的。据我们所知,这是首个实现这些速率的有限时间分析。虽然已知两个时间尺度分量会渐近解耦,但我们的结果通过表明这种现象实际上从某个有限时间开始发生,更明确地描绘了这一现象。最后,与现有工作相比,我们的结果适用于更广泛的步长族,包括非平方可和的步长。

关键词

引用

@article{arxiv.1911.09157,
  title  = {A Tale of Two-Timescale Reinforcement Learning with the Tightest Finite-Time Bound},
  author = {Gal Dalal and Balazs Szorenyi and Gugan Thoppe},
  journal= {arXiv preprint arXiv:1911.09157},
  year   = {2019}
}