中文

连续时间策略评估的统计保证:椭圆性之利与新的权衡

机器学习 2025-02-07 v1 最优化与控制 概率论 统计理论 统计理论

摘要

我们研究使用单条离散观测的遍历轨迹估计连续时间马尔可夫扩散过程的价值函数。我们的工作为最小二乘时序差分(LSTD)方法提供了非渐近统计保证,性能以一阶索博列夫范数度量。具体而言,当使用长度为 TT 的轨迹时,估计器达到 O(1/T)O(1 / \sqrt{T}) 的收敛速率;值得注意的是,只要 TT 与扩散的混合时间和所使用基函数的数量几乎呈线性关系,即可达到此速率。我们方法的一个关键洞见是,扩散过程固有的椭圆性确保了即使在有效时间范围趋于无穷时也能保持稳健性能。此外,我们证明统计误差的马尔可夫分量可由逼近误差控制,而鞅分量相对于基函数数量以较慢速率增长。通过仔细平衡这两种误差来源,我们的分析揭示了逼近误差与统计误差之间新颖的权衡。

关键词

引用

@article{arxiv.2502.04297,
  title  = {Statistical guarantees for continuous-time policy evaluation: blessing of ellipticity and new tradeoffs},
  author = {Wenlong Mou},
  journal= {arXiv preprint arXiv:2502.04297},
  year   = {2025}
}