中文

离屏评估中的状态相关性

机器学习 2021-09-15 v1 机器学习

摘要

基于重要性采样的离屏评估(OPE)估计器因其简单性、无偏性以及对相对较少假设的依赖而受到重视。然而,这些估计器的方差通常较高,尤其是在轨迹长度不同的情况下。在这项工作中,我们提出了忽略与回报无关状态的重要性采样(OSIRIS),这是一种通过策略性地忽略与某些状态相关的似然比来降低方差的估计器。我们形式化了 OSIRIS 无偏且方差低于普通重要性采样的条件,并通过实验证明了这些性质。

关键词

引用

@article{arxiv.2109.06310,
  title  = {State Relevance for Off-Policy Evaluation},
  author = {Simon P. Shen and Yecheng Jason Ma and Omer Gottesman and Finale Doshi-Velez},
  journal= {arXiv preprint arXiv:2109.06310},
  year   = {2021}
}

备注

ICML 2021