中文

无视觉输入的视觉基础规划:语言模型从高层指令推断详细计划

计算与语言 2020-10-28 v2 计算机视觉与模式识别

摘要

最近提出的 ALFRED 挑战任务旨在让虚拟机器人代理在虚拟家庭环境中,根据“将一片热面包放到盘子上”这类高层自然语言指令完成复杂的多步日常任务。目前性能最佳的模型成功完成这些任务的比例不足 5%。本文聚焦于将自然语言指令转换为在虚拟环境中实现这些目标的详细多步动作序列这一建模翻译问题。我们经实证表明,在 26% 的未见案例中,仅依靠语言指令而无需任何视觉输入即可生成黄金多步计划。当引入少量视觉信息(即虚拟环境中的起始位置)时,我们性能最佳的 GPT-2 模型在 58% 的案例中成功生成黄金指令序列。我们的结果表明,上下文语言模型可为具身虚拟代理提供强大的视觉语义规划模块。

关键词

引用

@article{arxiv.2009.14259,
  title  = {Visually-Grounded Planning without Vision: Language Models Infer Detailed Plans from High-level Instructions},
  author = {Peter A. Jansen},
  journal= {arXiv preprint arXiv:2009.14259},
  year   = {2020}
}

备注

Accepted to Findings of EMNLP. V2: corrected typo Table 1; margins Table 3