单条轨迹下的策略评估:多步方法、混合与模型误设
机器学习
2022-11-09 v1 机器学习
统计理论
统计理论
摘要
我们研究利用单条轨迹的观测对无限 horizon 折扣马尔可夫奖励过程(MRP)的值函数进行非参数估计。我们为一般的基于核的多步时序差分(TD)估计族提供了非渐近保证,包括规范的 步前瞻 TD()与 TD 族()作为特例。我们的界刻画了其对 Bellman 波动、马尔可夫链混合时间、模型中任何误设以及定义估计量本身的权重函数选择的依赖,并揭示了混合时间与模型误设之间某些微妙的相互作用。对于应用于良设模型的给定 TD 方法,其在轨迹数据下的统计误差类似于独立同分布样本转移对的误差,而在误设下,数据中的时间依赖性会放大统计误差。然而,任何此类恶化都可通过增加前瞻步数来缓解。我们以证明极小极大下界补充了上界,确立了具有适当前瞻与加权的基于 TD 方法的最优性,并揭示了值函数估计与常规范非参数回归之间的某些根本差异。
引用
@article{arxiv.2211.03899,
title = {Policy evaluation from a single path: Multi-step methods, mixing and mis-specification},
author = {Yaqi Duan and Martin J. Wainwright},
journal= {arXiv preprint arXiv:2211.03899},
year = {2022}
}