中文

利用混淆观测数据实现可证明高效的因果强化学习

机器学习 2020-06-23 v1 机器学习

摘要

借助神经网络等具有强表达能力的函数逼近器,深度强化学习(DRL)取得了巨大的实证成功。然而,学习具有强表达能力的函数逼近器需要通过与环境交互来收集大规模数据集(干预数据)。这种样本效率的不足阻碍了 DRL 在关键场景中的应用,例如自动驾驶与个性化医疗,因为在线设定下的试错往往不安全甚至不道德。本文研究如何引入离线收集的、在实践中通常大量可用的数据集(观测数据),以提升在线设定下的样本效率。为引入可能存在混淆的观测数据,我们提出了去混淆乐观值迭代(DOVI)算法,该算法以可证明高效的方式纳入混淆观测数据。更具体地,DOVI 显式地修正观测数据中的混淆偏差,其中混淆因子部分可观测或不可观测。在这两种情况下,此类修正使我们能够基于信息增益这一概念构造奖励 bonus,该概念考虑了从离线设定中获取的信息量。特别地,我们证明 DOVI 的 regret 小于纯在线设定下可达到的最优 regret 的一个乘性因子,且该因子在混淆观测数据经修正后信息量更大时趋于零。我们的算法与分析是迈向因果强化学习的一步。

关键词

引用

@article{arxiv.2006.12311,
  title  = {Provably Efficient Causal Reinforcement Learning with Confounded Observational Data},
  author = {Lingxiao Wang and Zhuoran Yang and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2006.12311},
  year   = {2020}
}

备注

42 pages, 4 figures