中文

离屏策略评估中非参数 Q 函数估计的适定性及极小极大最优速率

统计理论 2022-06-28 v3 机器学习 计量经济学 机器学习 统计理论

摘要

我们研究具有连续状态与动作的无限 horizon(时域)马尔可夫决策过程中的离屏策略评估(off-policy evaluation, OPE)问题。我们将 QQ 函数估计重新表述为非参数工具变量(nonparametric instrumental variables, NPIV)估计的一种特殊形式。我们首先证明,在一个温和条件下,QQ 函数估计的 NPIV 表述在相对于数据生成分布的 L2L^2 病态性度量意义下是适定的,从而绕过了近期文献中为获得各类 QQ 函数估计量的 L2L^2 收敛速率而对折扣因子 γ\gamma 施加的强假设。得益于这一新的适定性质,我们推导出了 QQ 函数及其导数在 sup-范数与 L2L^2-范数下非参数估计收敛速率的首次极小极大下界,其被证明与经典非参数回归(Stone, 1982)的相同。随后我们提出一种筛两阶段最小二乘估计量,并在一些温和条件下建立了其在两种范数下的速率最优性。我们关于适定性与极小极大下界的一般结果,对于研究不仅其他 QQ 函数的非参数估计量,还有离屏设置下任意目标策略价值的效率估计,均具有独立意义。

关键词

引用

@article{arxiv.2201.06169,
  title  = {On Well-posedness and Minimax Optimal Rates of Nonparametric Q-function Estimation in Off-policy Evaluation},
  author = {Xiaohong Chen and Zhengling Qi},
  journal= {arXiv preprint arXiv:2201.06169},
  year   = {2022}
}