中文

面向连续控制的可组合神经程序学习

人工智能 2021-04-14 v2

摘要

我们提出了一种新颖的方案,用于解决需要在多个抽象层级进行分层规划的困难稀疏奖励连续控制问题。我们的方案称为 AlphaNPI-X,包含三个独立的学习阶段。首先,我们利用带经验回放的离策略强化学习算法学习一组原子目标条件策略,其可轻易用于多种任务。其次,我们学习描述原子策略对环境作用的自模型。第三,利用自模型学习具有多抽象层级的递归组合程序。关键洞见在于,自模型支持基于想象的规划,从而在习得更高层组合程序时免除与世界交互的需要。为完成第三阶段学习,我们扩展了 AlphaNPI 算法,其将 AlphaZero 应用于学习递归神经程序员-解释器。我们经实验表明,AlphaNPI-X 能有效学会应对如堆叠多个方块等困难稀疏操作任务,而强大的无模型基线方法在此失败。

关键词

引用

@article{arxiv.2007.13363,
  title  = {Learning Compositional Neural Programs for Continuous Control},
  author = {Thomas Pierrot and Nicolas Perrin and Feryal Behbahani and Alexandre Laterre and Olivier Sigaud and Karim Beguir and Nando de Freitas},
  journal= {arXiv preprint arXiv:2007.13363},
  year   = {2021}
}