中文

面向部分可观测环境的程序合成引导强化学习

人工智能 2021-11-03 v2

摘要

强化学习的一个关键挑战是求解长视野规划问题。近期工作已利用程序在这些设定中引导强化学习。然而,这些方法给用户带来了很高的手动负担,因为必须为每个新任务提供引导程序。部分可观测环境进一步使编程任务复杂化,因为程序必须实现一种策略,能够正确且理想地最优处理环境中隐藏区域的每一种可能配置。我们提出一种新方法——模型预测程序合成(MPPS),它使用程序合成来自动生成引导程序。该方法训练一个生成模型来预测世界中未观测到的部分,并基于该模型的采样以对其不确定性具有鲁棒性的方式合成程序。在我们的实验中,我们表明该方法在一组具有挑战性的基准上显著优于非程序引导的方法,包括一个 2D 受 Minecraft 启发的环境,其中智能体必须完成一系列复杂的子任务以实现其目标,并且达到了与使用手工编写程序引导智能体相似的性能。我们的结果表明,我们的方法能够获得程序引导强化学习的益处,而无需用户为每个新任务提供新的引导程序。

关键词

引用

@article{arxiv.2102.11137,
  title  = {Program Synthesis Guided Reinforcement Learning for Partially Observed Environments},
  author = {Yichen David Yang and Jeevana Priya Inala and Osbert Bastani and Yewen Pu and Armando Solar-Lezama and Martin Rinard},
  journal= {arXiv preprint arXiv:2102.11137},
  year   = {2021}
}