基于自监督世界模型规划的过程泛化
机器学习
2021-11-03 v1 人工智能
摘要
基于模型的强化学习的关键承诺之一,是利用对世界的内部模型在新环境和任务中进行预测从而实现泛化。然而,基于模型智能体的泛化能力尚未得到充分理解,因为现有工作在基准测试泛化时主要关注无模型智能体。在此,我们明确测量了基于模型智能体相较于其无模型对应体的泛化能力。我们将分析重点放在 MuZero(Schrittwieser 等人,2020)这一强大的基于模型智能体上,并评估其在过程泛化和任务泛化上的表现。我们识别出过程泛化的三个因素——规划、自监督表示学习和过程数据多样性——并表明,通过结合这些技术,我们在 Procgen(Cobbe 等人,2019)上实现了最先进的泛化性能和数据效率。然而,我们发现这些因素并非总能为 Meta-World(Yu 等人,2019)中的任务泛化基准带来同样的益处,这表明迁移仍然是一个挑战,可能需要不同于过程泛化的方法。总体而言,我们建议构建可泛化的智能体需要超越单任务、无模型的范式,转向在丰富的、过程性的、多任务环境中训练的基于自监督模型的智能体。
引用
@article{arxiv.2111.01587,
title = {Procedural Generalization by Planning with Self-Supervised World Models},
author = {Ankesh Anand and Jacob Walker and Yazhe Li and Eszter Vértes and Julian Schrittwieser and Sherjil Ozair and Théophane Weber and Jessica B. Hamrick},
journal= {arXiv preprint arXiv:2111.01587},
year = {2021}
}