中文

Krylov-Bellman 提升:一般状态空间中的超线性策略评估

机器学习 2023-03-28 v1 机器学习 最优化与控制 统计理论 统计理论

摘要

我们提出并分析了用于一般状态空间中策略评估的 Krylov-Bellman 提升(KBB)算法。它在使用非参数回归拟合 Bellman 残差(如提升中那样)与通过最小二乘时序差分(LSTD)过程估计值函数之间交替进行,后者所用特征集随时间自适应增长。通过利用与 Krylov 方法的联系,我们为该方法提供了两项吸引人的保证。首先,我们给出了一个通用收敛界,允许残差拟合与 LSTD 计算中存在独立的估计误差。与我们的数值实验一致,该界表明收敛速率取决于受限谱结构,且通常为超线性。其次,通过将此元结果与依赖于样本量的残差拟合和 LSTD 计算保证相结合,我们获得了具体的统计保证,其依赖于样本量以及用于拟合残差的函数类的复杂度。我们针对各类策略评估问题展示了 KBB 算法的表现,并且相对于标准拟合值迭代方法通常发现样本复杂度的大幅降低。

关键词

引用

@article{arxiv.2210.11377,
  title  = {Krylov-Bellman boosting: Super-linear policy evaluation in general state spaces},
  author = {Eric Xia and Martin J. Wainwright},
  journal= {arXiv preprint arXiv:2210.11377},
  year   = {2023}
}

备注

40 pages, 7 figures