中文

通过条件重要性采样理解离屏评估中的时域诅咒

机器学习 2020-06-09 v2 机器学习

摘要

使用重要性采样(IS)的离屏策略估计器在长时域域中可能遭受高方差,而利用马尔可夫决策过程结构的新IS方法近来备受关注。我们通过条件蒙特卡洛的视角分析最流行方法的方差。令人惊讶的是,我们发现有限时域MDP中,相较于朴素重要性采样,逐决策重要性采样或平稳重要性采样并不存在严格的方差缩减。进而我们给出充分条件,使得逐决策或平稳估计器在有限时域上可证明地缩减相对于重要性采样的方差。对于渐近(按时域 TT 而言)情形,我们建立了这些估计器方差的上界与下界,由此得到充分条件:在这些条件下,重要性采样与逐决策或平稳估计器方差间存在指数级与多项式级的差距。这些结果有助于推进我们对新型IS估计器是否以及何时能提升离屏估计准确性的理解。

关键词

引用

@article{arxiv.1910.06508,
  title  = {Understanding the Curse of Horizon in Off-Policy Evaluation via Conditional Importance Sampling},
  author = {Yao Liu and Pierre-Luc Bacon and Emma Brunskill},
  journal= {arXiv preprint arXiv:1910.06508},
  year   = {2020}
}

备注

Accepted by ICML 2020, 21 pages, 1 figure