无限 horizon 强化学习的黑盒离屏估计
机器学习
2020-03-26 v1 人工智能
机器学习
摘要
长 horizon 问题的离屏(off-policy)估计在医疗和机器人等许多实际应用中十分重要,其中高保真模拟器可能不可用,且在线策略评估代价高昂或不可能实现。最近,\cite{liu18breaking} 提出了一种方法,避免了典型基于重要性采样的方法所遭受的\emph{horizon 诅咒}(curse of horizon)。尽管显示出有前景的结果,该方法在实践中受限,因为它要求数据来自\emph{已知}行为策略的\emph{平稳分布}。在本工作中,我们提出一种消除此类限制的新方法。具体而言,我们将该问题表述为求解某算子的不动点。利用再生核希尔伯特空间(Reproducing Kernel Hilbert Spaces, RKHSs)中的工具,我们开发了一种新估计器,可在不知晓离屏数据如何收集的情况下计算平稳分布的重要性比率。我们分析了其渐近一致性与有限样本泛化能力。在基准上的实验验证了我们所提方法的有效性。
引用
@article{arxiv.2003.11126,
title = {Black-box Off-policy Estimation for Infinite-Horizon Reinforcement Learning},
author = {Ali Mousavi and Lihong Li and Qiang Liu and Denny Zhou},
journal= {arXiv preprint arXiv:2003.11126},
year = {2020}
}
备注
Published at ICLR 2020