中文

多行为策略下的无限 horizon 离策略策略评估

机器学习 2019-10-14 v1 机器学习

摘要

我们考虑当轨迹数据由多个行为策略生成时的离策略策略评估。近期工作表明了在无限horizon背景下,状态或状态-动作平稳分布校正对于离策略策略评估所起的关键作用。我们提出估计混合策略(EMP),一类新颖的部分策略不可知方法,以准确估计这些量。通过细致分析,我们表明EMP在估计状态平稳分布校正时给出了方差降低的估计,同时也为估计状态-动作平稳分布校正提供了有用的归纳偏置。在连续与离散环境的广泛实验中,我们证明了我们的算法相比最先进的方法具有显著更高的准确性。

关键词

引用

@article{arxiv.1910.04849,
  title  = {Infinite-horizon Off-Policy Policy Evaluation with Multiple Behavior Policies},
  author = {Xinyun Chen and Lu Wang and Yizhe Hang and Heng Ge and Hongyuan Zha},
  journal= {arXiv preprint arXiv:1910.04849},
  year   = {2019}
}

备注

16 pages