中文

基于模型的深度强化学习中规划的作用探析

人工智能 2021-03-18 v2 机器学习

摘要

基于模型的规划通常被认为对于人工智能体的深度、审慎推理与泛化是必要的。尽管近期基于模型的强化学习(MBRL)结合深度函数逼近的成功强化了这一假设,但由此产生的基于模型方法的多样性也使得追踪哪些组件驱动了成功及其原因变得困难。在本文中,我们旨在通过关注三个问题来厘清近期方法的贡献:(1)规划如何惠及 MBRL 智能体?(2)在规划内部,哪些选择驱动了性能?(3)规划在多大程度上改善了泛化?为回答这些问题,我们研究了 MuZero(Schrittwieser 等人,2019)的性能,这是一种最先进的 MBRL 算法,与许多其他 MBRL 算法具有紧密的联系和重叠的组件。我们在广泛的环境中对 MuZero 进行了大量干预和消融实验,包括控制任务、Atari 和 9x9 围棋。我们的结果表明如下:(1)规划在学习过程中最为有用,既用于策略更新,也用于提供更有效的数据分布。(2)除最困难的推理任务外,使用浅层树与简单蒙特卡洛展开(Monte-Carlo rollouts)与更复杂的方法性能相当。(3)仅靠规划不足以驱动强泛化。这些结果指出了在强化学习设置中何处及如何利用规划,并凸显了未来 MBRL 研究的一系列开放问题。

关键词

引用

@article{arxiv.2011.04021,
  title  = {On the role of planning in model-based deep reinforcement learning},
  author = {Jessica B. Hamrick and Abram L. Friesen and Feryal Behbahani and Arthur Guez and Fabio Viola and Sims Witherspoon and Thomas Anthony and Lars Buesing and Petar Veličković and Théophane Weber},
  journal= {arXiv preprint arXiv:2011.04021},
  year   = {2021}
}

备注

Published at ICLR 2021