中文

具有潜在混杂因素的无限 horizon 强化学习中的离屏策略评估

机器学习 2020-07-29 v1 人工智能 机器学习

摘要

强化学习中的离屏策略评估(OPE)在实验受限的环境(如教育和医疗)中是一个重要问题。但在这些同样的环境中,观测到的动作常受未观测变量混杂,使 OPE 更加困难。我们研究了一个无限 horizon、遍历马尔可夫决策过程中具有未观测混杂因素的 OPE 问题,其中状态和行为可作为未观测混杂因素的代理。我们展示了如何仅给定状态和动作的潜变量模型,就能从离屏策略数据中识别策略价值。我们的方法包括两个阶段。在第一阶段,我们展示如何利用代理估计平稳分布比,将近期关于打破 horizon 诅咒的工作扩展到混杂环境。在第二阶段,我们展示最优平衡可与此类学习到的比率结合以获得策略价值,同时避免对奖励函数的直接建模。我们建立了一致性的理论保证,并在经验上对我们的方法进行了基准测试。

关键词

引用

@article{arxiv.2007.13893,
  title  = {Off-policy Evaluation in Infinite-Horizon Reinforcement Learning with Latent Confounders},
  author = {Andrew Bennett and Nathan Kallus and Lihong Li and Ali Mousavi},
  journal= {arXiv preprint arXiv:2007.13893},
  year   = {2020}
}