中文

在少量无奖励部署中学习通用世界模型

机器学习 2022-10-25 v1 人工智能

摘要

构建具有通用能力的智能体是深度强化学习(RL)的一大挑战。为切实应对该挑战,我们提出两个关键诉求:1)为促进泛化,探索应与任务无关;2)为促进可扩展性,探索策略应在无需昂贵集中重训练的情况下收集大量数据。结合这两种特性,我们引入无奖励部署效率设定,一种RL研究的新范式。随后我们提出CASCADE,一种在该新设定下用于自监督探索的新方法。CASCADE受贝叶斯主动学习启发,利用信息论目标,通过智能体群体收集数据以学习世界模型。CASCADE通过一种新颖的级联目标,专门最大化群体所采样轨迹的多样性来实现这一点。我们提供了CASCADE的理论直观,并在表格设定中表明其优于未考虑群体多样性的朴素方法。我们进而展示CASCADE在Atari、MiniGrid、Crafter与DM Control Suite上收集了多样的任务无关数据集,并学习了能零样本泛化至新颖、未见下游任务的智能体。代码与视频见 https://ycxuyingchen.github.io/cascade/

关键词

引用

@article{arxiv.2210.12719,
  title  = {Learning General World Models in a Handful of Reward-Free Deployments},
  author = {Yingchen Xu and Jack Parker-Holder and Aldo Pacchiano and Philip J. Ball and Oleh Rybkin and Stephen J. Roberts and Tim Rocktäschel and Edward Grefenstette},
  journal= {arXiv preprint arXiv:2210.12719},
  year   = {2022}
}

备注

To be published at NeurIPS 2022. Code and videos available at https://ycxuyingchen.github.io/cascade/