中文

基于因果结构化世界模型的离线强化学习

机器学习 2022-06-06 v1 机器学习

摘要

基于模型的方法近期在离线强化学习(RL)中展现出前景,旨在从历史数据中学习优良策略而无需与环境交互。以往的基于模型的离线RL方法学习全连接网络作为世界模型,将状态和动作映射到下一步状态。然而,合理的做法是世界模型应遵循底层的因果效应,从而支持学习在未见状态中泛化良好的有效策略。本文首先提供理论结果,表明通过将因果结构纳入泛化误差界,因果世界模型可优于普通世界模型用于离线RL。然后我们提出一种实用算法,即基于因果结构的离线模型强化学习(oFfline mOdel-based reinforcement learning with CaUsal Structure, FOCUS),以说明在离线RL中学习并利用因果结构的可行性。在两个基准上的实验结果表明,FOCUS准确且鲁棒地重建了底层因果结构。因此,其性能优于普通的基于模型的离线RL算法及其他基于因果模型的RL算法。

关键词

引用

@article{arxiv.2206.01474,
  title  = {Offline Reinforcement Learning with Causal Structured World Models},
  author = {Zheng-Mao Zhu and Xiong-Hui Chen and Hong-Long Tian and Kun Zhang and Yang Yu},
  journal= {arXiv preprint arXiv:2206.01474},
  year   = {2022}
}