基于核的时间差分方法的最优策略评估
机器学习
2021-09-27 v1 机器学习
统计理论
统计理论
摘要
我们研究了基于再生核希尔伯特空间(reproducing kernel Hilbert space)的方法来估计无限 horizon 折扣马尔可夫奖励过程(Markov reward process, MRP)的值函数。我们研究了核最小二乘时间差分(kernel least-squares temporal difference, LSTD)估计的正则化形式;在无限数据的总体极限下,它对应于由相关再生核希尔伯特空间定义的投影贝尔曼算子的不动点。估计量本身通过求解由经验算子的正则化版本诱导的投影不动点获得;由于底层核结构,这简化为求解涉及核矩阵的线性系统。我们在 范数下分析该估计的误差,其中 表示底层马尔可夫链的平稳分布。我们的分析不对马尔可夫链的转移算子作任何假设,而仅对奖励函数与总体水平核 LSTD 解施加条件。我们利用经验过程理论技术推导了误差的非渐近上界,其显式依赖于相关核算子的特征值以及贝尔曼残差误差的实例相关方差。此外,我们证明了 MRP 子类的极小极大下界,表明我们的速率在样本量 和有效 horizon 意义下是最优的。现有最坏情况理论预测有效 horizon 的立方标度(),而我们的理论揭示事实上存在远为广泛的标度范围,取决于核、平稳分布以及贝尔曼残差误差的方差。值得注意的是,仅参数化和近参数化问题才可能达到最坏情况的立方标度。
引用
@article{arxiv.2109.12002,
title = {Optimal policy evaluation using kernel-based temporal difference methods},
author = {Yaqi Duan and Mengdi Wang and Martin J. Wainwright},
journal= {arXiv preprint arXiv:2109.12002},
year = {2021}
}