中文

通过结构化世界模型进行好奇探索实现零样本物体操控

机器学习 2022-11-29 v2 人工智能 机器人学

摘要

设计能够通过内在动机高效探索环境的人工智能体,类似于儿童进行好奇的自由玩耍,一直是一个长期的梦想。尽管内在动机强化学习(RL)最近取得了进展,物体操控场景中的样本高效探索仍然是一个重大挑战,因为大多数相关信息在于稀疏的智能体-物体和物体-物体交互中。在本文中,我们提出使用结构化世界模型在控制回路中引入关系归纳偏置,以在组合多物体环境中实现样本高效且交互丰富的探索。通过在结构化世界模型内规划未来新颖性,我们的方法生成自由玩耍行为,该行为早期即开始与物体交互并随时间发展出更复杂的行为。与通常仅将模型用于计算内在奖励不同,我们的方法展示了良好模型与良好探索之间的自我强化循环还开辟了另一条途径:通过基于模型的规划对下游任务进行零样本泛化。在完全内在的任务无关探索阶段之后,我们的方法解决了诸如堆叠、翻转、拾取与放置和投掷等具有挑战性的下游任务,这些任务泛化到未见过的物体数量和排列,无需任何额外训练。

关键词

引用

@article{arxiv.2206.11403,
  title  = {Curious Exploration via Structured World Models Yields Zero-Shot Object Manipulation},
  author = {Cansu Sancaktar and Sebastian Blaes and Georg Martius},
  journal= {arXiv preprint arXiv:2206.11403},
  year   = {2022}
}

备注

NeurIPS 2022 camera-ready version