中文

利用 Options 和协方差检验进行长视界离线策略评估

人工智能 2017-12-07 v2

摘要

在真实世界中部署策略来对其进行评估可能存在风险且成本高昂。离线策略评估 (OPE) 算法使用从运行先前策略中收集的历史数据来评估新策略,这提供了一种无需部署即可评估策略的方法。重要性采样是一种流行的 OPE 方法,因为它对部分可观测性具有鲁棒性,并且适用于连续状态和动作。然而,重要性采样所需的历史数据量可能会随着问题视界(即所做的顺序决策数量)呈指数级增长。我们提出使用基于时间延展动作(称为 options)的策略,并表明将这些策略与重要性采样相结合可以显著改善长视界问题的性能。此外,我们可以利用基于 options 的策略所产生的特殊情况来进一步提升重要性采样的性能。我们进一步将这些特殊情况推广为一般的协方差检验规则,该规则可用于决定在 IS 估计中丢弃哪些权重,并推导出一种名为增量重要性采样的新 IS 算法,该算法可以为广泛的领域提供更准确的估计。

关键词

引用

@article{arxiv.1703.03453,
  title  = {Using Options and Covariance Testing for Long Horizon Off-Policy Policy Evaluation},
  author = {Zhaohan Daniel Guo and Philip S. Thomas and Emma Brunskill},
  journal= {arXiv preprint arXiv:1703.03453},
  year   = {2017}
}