中文

一致的在线离策略评估

机器学习 2017-02-24 v1 机器学习

摘要

由于在线离策略评估(OPE)作为一个独立问题以及作为策略改进方案中的一个模块的重要性,在过去十年中得到了积极研究。然而,大多数基于时序差分(TD)的解法忽略了行为策略和目标策略的平稳分布之间的差异及其在函数逼近应用时对收敛极限的影响。本文提出一致离策略时序差分(COP-TD(λ\lambda, β\beta))算法,该算法以一定的计算代价解决了这一问题并减小了此偏差。我们表明COP-TD(λ\lambda, β\beta)可以被设计为收敛到与使用目标策略的同策略TD(λ\lambda)所将获得的相同值。随后,所提方案导出了一个相关且有前景的启发式方法,我们称之为log-COP-TD(λ\lambda, β\beta)。两种算法相对于当前最先进的在线OPE算法均具有良好的实证结果。最后,我们的公式为最近提出的强调型TD学习(Emphatic TD learning)提供了新的见解。

关键词

引用

@article{arxiv.1702.07121,
  title  = {Consistent On-Line Off-Policy Evaluation},
  author = {Assaf Hallak and Shie Mannor},
  journal= {arXiv preprint arXiv:1702.07121},
  year   = {2017}
}