中文

无限 horizon 强化学习中的混杂稳健策略评估

机器学习 2020-07-14 v2 最优化与控制 机器学习

摘要

在批强化学习应用(如教育与医疗)中,基于观测数据对序贯决策策略进行离屏策略评估是必要的。然而,在此类场景中,未观测变量混杂了已观测动作,使得对新策略的精确评估不可能实现,即不可识别。我们开发了一种稳健方法,在给定来自另一受未观测混杂影响的策略的数据及一个敏感性模型下,估计无限 horizon 问题中给定策略(不可识别)价值的尖锐界。我们考虑平稳或基线未观测混杂,并通过在所有与新的部分可识别估计方程及敏感性模型一致的平稳状态占用比集合上优化来计算边界。我们证明随着收集更多混杂数据,可收敛至尖锐界。尽管检验集合隶属关系是一个线性规划,但其支撑函数由一个困难的非凸优化问题给出。我们基于非凸投影梯度下降开发了近似方法,并实证展示了所得边界。

关键词

引用

@article{arxiv.2002.04518,
  title  = {Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning},
  author = {Nathan Kallus and Angela Zhou},
  journal= {arXiv preprint arXiv:2002.04518},
  year   = {2020}
}