基于广义Bellman算子的离屏TD学习的有限样本分析
机器学习
2021-06-25 v1 最优化与控制
机器学习
摘要
在时序差分(TD)学习中,离屏采样比在屏采样更为实用,且通过解耦学习与数据收集,它实现了数据复用。已知策略评估(包括多步离屏重要性采样)具有求解广义Bellman方程的解释。本文中,我们推导了任意求解该广义Bellman算子不动点的通用离屏TD类随机近似算法的有限样本界。我们的关键步骤是证明广义Bellman算子同时是关于加权-范数的收缩映射,对每个均成立,且具有共同的收缩因子。离屏TD学习已知会因重要性采样比率的乘积而遭受高方差。文献中已提出多种算法(例如、Tree-Backup、Retrace和-trace)来解决此问题。我们的结果立即隐含了这些算法的有限样本界。特别地,我们提供了、Tree-Backup和Retrace的首次已知有限样本保证,并改进了[19]中-trace的最佳已知界。此外,我们展示了这些算法中的偏差-方差权衡。
引用
@article{arxiv.2106.12729,
title = {Finite-Sample Analysis of Off-Policy TD-Learning via Generalized Bellman Operators},
author = {Zaiwei Chen and Siva Theja Maguluri and Sanjay Shakkottai and Karthikeyan Shanmugam},
journal= {arXiv preprint arXiv:2106.12729},
year = {2021}
}