利用观测性与干预性数据的因果强化学习
机器学习
2021-06-29 v1
摘要
高效学习环境的因果模型是基于模型的强化学习智能体在部分可观测马尔可夫决策过程(POMDP)中运行的一个关键挑战。我们在此考虑这样一种场景:学习智能体能够通过与环境直接交互(干预性数据)收集在线经验,同时也能访问大量离线经验,这些离线经验通过观测另一个智能体与环境交互而获得(观测性数据)。使这一情形变得非平凡的一个关键因素是,我们允许被观测的智能体基于隐藏信息与环境交互,而该隐藏信息不被学习智能体所观测。我们随后提出以下问题:在线与离线经验能否被安全地结合以学习因果模型?我们能否期望离线经验提升智能体的性能?为回答这些问题,我们引入了成熟完善的do演算因果框架中的思想,并将基于模型的强化学习表述为一个因果推断问题。接着,我们提出了一种通用而简单的方法论,用于在训练中利用离线数据。简而言之,该方法依赖于学习一个基于隐变量的因果转移模型,该模型同时解释干预性与观测性机制,随后利用恢复出的隐变量通过去混杂推断标准的POMDP转移模型。我们证明了我们的方法是正确的且高效的,原因在于其借助离线数据(在渐近情形下)获得了更好的泛化保证,并在合成玩具问题上以经验方式展示了其有效性。我们的贡献旨在弥合强化学习与因果性两个领域之间的鸿沟。
引用
@article{arxiv.2106.14421,
title = {Causal Reinforcement Learning using Observational and Interventional Data},
author = {Maxime Gasse and Damien Grasset and Guillaume Gaudron and Pierre-Yves Oudeyer},
journal= {arXiv preprint arXiv:2106.14421},
year = {2021}
}