中文

具有一般光滑函数逼近的双时间尺度 TDC 的非渐近分析

机器学习 2021-10-29 v4

摘要

带梯度修正的时序差分学习(TDC)是强化学习中用于策略评估的双时间尺度算法。该算法最初以线性函数逼近提出,后来扩展到具有一般光滑函数逼近的版本。具有一般光滑函数逼近的 on-policy 设定的渐近收敛性在 [bhatnagar2009convergent] 中已确立,然而由于非线性和双时间尺度更新结构、非凸目标函数以及到切平面上的时变投影所带来的挑战,有限样本分析仍未解决。在本文中,我们开发新技术来明确刻画具有 i.i.d. 或马尔可夫样本的一般 off-policy 设定的有限样本误差界,并证明其收敛速度可达 O(1/T)\mathcal O(1/\sqrt T)(至多相差一个 O(logT)\mathcal O(\log T) 因子)。我们的方法可应用于具有一般光滑函数逼近的广泛基于值的强化学习算法。

关键词

引用

@article{arxiv.2104.02836,
  title  = {Non-Asymptotic Analysis for Two Time-scale TDC with General Smooth Function Approximation},
  author = {Yue Wang and Shaofeng Zou and Yi Zhou},
  journal= {arXiv preprint arXiv:2104.02836},
  year   = {2021}
}

备注

Accepted by NeurIPS 2021