中文

基于广义Bellman算子的离屏TD学习的有限样本分析

机器学习 2021-06-25 v1 最优化与控制 机器学习

摘要

在时序差分(TD)学习中,离屏采样比在屏采样更为实用,且通过解耦学习与数据收集,它实现了数据复用。已知策略评估(包括多步离屏重要性采样)具有求解广义Bellman方程的解释。本文中,我们推导了任意求解该广义Bellman算子不动点的通用离屏TD类随机近似算法的有限样本界。我们的关键步骤是证明广义Bellman算子同时是关于加权p\ell_p-范数的收缩映射,对每个p[1,)p\in[1,\infty)均成立,且具有共同的收缩因子。离屏TD学习已知会因重要性采样比率的乘积而遭受高方差。文献中已提出多种算法(例如Qπ(λ)Q^\pi(\lambda)、Tree-Backup(λ)(\lambda)、Retrace(λ)(\lambda)QQ-trace)来解决此问题。我们的结果立即隐含了这些算法的有限样本界。特别地,我们提供了Qπ(λ)Q^\pi(\lambda)、Tree-Backup(λ)(\lambda)和Retrace(λ)(\lambda)的首次已知有限样本保证,并改进了[19]中QQ-trace的最佳已知界。此外,我们展示了这些算法中的偏差-方差权衡。

关键词

引用

@article{arxiv.2106.12729,
  title  = {Finite-Sample Analysis of Off-Policy TD-Learning via Generalized Bellman Operators},
  author = {Zaiwei Chen and Siva Theja Maguluri and Sanjay Shakkottai and Karthikeyan Shanmugam},
  journal= {arXiv preprint arXiv:2106.12729},
  year   = {2021}
}