打破视界诅咒:无限视界离屏策略估计
机器学习
2018-10-31 v1 人工智能
系统与控制
机器学习
摘要
我们考虑离屏策略估计问题,即使用由不同行为策略收集的样本来估计目标策略的期望奖励。重要性采样(IS)一直是推导(近乎)无偏估计量的关键技术,但已知在长视界问题中方差极高。在无限视界问题的极端情况下,基于IS的估计量方差甚至可能是无界的。本文提出一种新的离屏策略估计方法,直接在平稳状态访问分布上应用IS,以避免现有估计量面临的方差爆炸问题。我们的关键贡献是一种仅用从行为分布中采样的轨迹来估计两个平稳分布密度比的新方法。我们针对该估计问题开发了极小极大损失函数,并推导了 RKHS 情况下的闭式解。我们用理论和实证分析支撑了我们的方法。
引用
@article{arxiv.1810.12429,
title = {Breaking the Curse of Horizon: Infinite-Horizon Off-Policy Estimation},
author = {Qiang Liu and Lihong Li and Ziyang Tang and Dengyong Zhou},
journal= {arXiv preprint arXiv:1810.12429},
year = {2018}
}
备注
21 pages, 5 figures, NIPS 2018 (spotlight)