中文

面向强化学习的内在高效、稳定且有界的离屏策略评估

机器学习 2019-06-11 v1 机器学习

摘要

在上下文老虎机和强化学习中,离屏策略评估(OPE)使人能够评估新决策策略而无需进行探索,而探索通常代价高昂或不可行。该问题的重要性吸引了众多提出的解决方案,包括重要性采样(IS)、自归一化IS(SNIS)和双重稳健(DR)估计。若Q函数设定良好,DR及其变体确保半参数局部效率,但若非如此,它们可能比IS和SNIS都更差。它也不具备SNIS固有的稳定性与有界性。我们提出了基于经验似然的OPE新估计量,其始终比IS、SNIS和DR更高效,并满足与SNIS相同的稳定性和有界性性质。在此过程中,我们对各类性质进行了分类,并据此对现有估计量归类。除理论保证外,实证研究表明新估计量具有优势。

关键词

引用

@article{arxiv.1906.03735,
  title  = {Intrinsically Efficient, Stable, and Bounded Off-Policy Evaluation for Reinforcement Learning},
  author = {Nathan Kallus and Masatoshi Uehara},
  journal= {arXiv preprint arXiv:1906.03735},
  year   = {2019}
}