中文

通过递归树搜索与规划学习组合式神经程序

人工智能 2021-04-14 v2

摘要

我们提出了一种新颖的强化学习算法 AlphaNPI,它结合了神经程序解释器(NPI)与 AlphaZero 的优势。NPI 以模块化、层次化和递归的形式提供结构偏置,有助于降低采样复杂度、改善泛化能力并增强可解释性。AlphaZero 提供了强大的神经网络引导搜索算法,我们对其进行了递归增强。AlphaNPI 仅假设一个带有稀疏奖励的层次化程序规范:当程序执行满足规范时为 1,否则为 0。利用该规范,AlphaNPI 首次能够用强化学习有效地训练 NPI 模型,完全消除了对以执行轨迹形式存在的强监督的需求。实验表明,AlphaNPI 的排序能力与先前强监督的 NPI 变体相当。AlphaNPI 智能体还在两个圆盘的天汉塔谜题上进行了训练,并展示出对任意数量圆盘的泛化能力。

关键词

引用

@article{arxiv.1905.12941,
  title  = {Learning Compositional Neural Programs with Recursive Tree Search and Planning},
  author = {Thomas Pierrot and Guillaume Ligner and Scott Reed and Olivier Sigaud and Nicolas Perrin and Alexandre Laterre and David Kas and Karim Beguir and Nando de Freitas},
  journal= {arXiv preprint arXiv:1905.12941},
  year   = {2021}
}