中文

ALFWorld:对齐文本与具身环境以进行交互式学习

计算与语言 2021-03-16 v2 人工智能 计算机视觉与模式识别 机器学习 机器人学

摘要

给定一个如“将洗过的苹果放入厨房冰箱”这样的简单请求,人类可以纯粹在抽象层面进行推理,通过想象动作序列并评估其成功可能性、典型性和效率,而无需动弹分毫。一旦我们见到所指的厨房,便可更新抽象计划以适配场景。具身智能体需要同样的能力,但现有工作尚未提供同时支持抽象推理与具体执行所需的基础设施。我们通过引入 ALFWorld 来解决这一局限,这是一个使智能体能够在 TextWorld (Côté et al., 2018) 中学习基于文本的抽象策略,随后在丰富的视觉环境中执行来自 ALFRED 基准 (Shridhar et al., 2020) 的目标的模拟器。ALFWorld 支持创建一个全新的 BUTLER 智能体,其在 TextWorld 中学习的抽象知识直接对应于具体的、视觉接地 (visually grounded) 的动作。我们实证表明,这进而比仅在视觉接地环境中训练带来更好的智能体泛化能力。BUTLER 简洁、模块化的设计将问题分解,使研究者能够专注于改进流水线中每一部分的模型(语言理解、规划、导航与视觉场景理解)。

关键词

引用

@article{arxiv.2010.03768,
  title  = {ALFWorld: Aligning Text and Embodied Environments for Interactive Learning},
  author = {Mohit Shridhar and Xingdi Yuan and Marc-Alexandre Côté and Yonatan Bisk and Adam Trischler and Matthew Hausknecht},
  journal= {arXiv preprint arXiv:2010.03768},
  year   = {2021}
}

备注

ICLR 2021; Data, code, and videos are available at alfworld.github.io