中文

用于组合状态与动作空间中基于模型学习与规划的世界程序

机器学习 2020-01-01 v1 机器学习

摘要

一些最重要的任务发生在缺乏廉价且完美模拟器的环境中,从而阻碍了无模型强化学习(RL)的应用。虽然基于模型的RL旨在学习动力学模型,但在更一般的情况下,学习者事先并不知道动作空间是什么。在此我们提出一种形式化方法,学习者通过观察状态-状态转移样本,在基于图的组合环境中学习动力学模型和动作,从而归纳出一个世界程序。然后,学习者可以使用该世界程序作为模拟器来执行RL以完成复杂规划任务。我们重点介绍了一个近期应用,并为学界提出了一项评估基于世界程序规划的挑战。

关键词

引用

@article{arxiv.1912.13007,
  title  = {World Programs for Model-Based Learning and Planning in Compositional State and Action Spaces},
  author = {Marwin H. S. Segler},
  journal= {arXiv preprint arXiv:1912.13007},
  year   = {2020}
}

备注

Accepted at the Generative Modeling and Model-Based Reasoning for Robotics and AI workshop at ICML 2019. Presented on June 14th 2019. See https://sites.google.com/view/mbrl-icml2019