中文

无模型规划的实证研究

机器学习 2019-05-21 v2 人工智能 机器学习

摘要

强化学习(RL)领域正面临具有组合复杂性的日益困难的领域。对于 RL 智能体应对这些挑战,能够有效规划至关重要。先前工作通常利用环境的显式模型,并结合特定规划算法(如树搜索)。近来,提出了一类新方法,通过学习如何规划,借助函数逼近器(如树结构神经网络)中的归纳偏置提供规划结构,并由无模型 RL 算法端到端训练。在本文中,我们更进一步,并通过实验证明,一种完全无模型的方法,除卷积网络和 LSTM 等标准神经网络组件外无特殊结构,可以学会展现许多通常与基于模型的规划器相关的特征。我们根据智能体在组合且不可逆状态空间上的泛化能力、数据效率以及利用额外思考时间的能力来衡量其规划有效性。我们发现我们的智能体具有人们可能在规划算法中预期的许多特征。此外,它在如 Sokoban 等困难组合领域超越了最先进水平,并优于其他利用强规划归纳偏置的无模型方法。

关键词

引用

@article{arxiv.1901.03559,
  title  = {An investigation of model-free planning},
  author = {Arthur Guez and Mehdi Mirza and Karol Gregor and Rishabh Kabra and Sébastien Racanière and Théophane Weber and David Raposo and Adam Santoro and Laurent Orseau and Tom Eccles and Greg Wayne and David Silver and Timothy Lillicrap},
  journal= {arXiv preprint arXiv:1901.03559},
  year   = {2019}
}