中文

广泛观察并双重解读:提升交互式指令跟随任务的性能

计算机视觉与模式识别 2021-06-08 v2

摘要

社区内对于让具身 AI 智能体在遵循自然语言指令与环境交互的同时执行复杂任务日益关注。近期研究使用专为该任务设计的优质数据集 ALFRED 来解决此问题,但仅取得了极低的准确率。本文提出一种新方法,大幅优于先前方法。该方法基于若干新思路的组合。其一是对所给指令进行两阶段解读。该方法首先在不使用视觉信息的情况下选择并解读指令,得到初步的动作序列预测;随后将预测与视觉信息等进行整合,得出最终的动作与物体预测。由于在第一阶段已确定待交互物体的类别,因而能够从输入图像中准确选出正确物体。此外,我们的方法考虑环境的多个以自我为中心的视角,并通过对当前指令施加条件分层注意力来提取关键信息,这有助于准确预测用于导航的动作。该方法的初步版本赢得了 ALFRED Challenge 2020。当前版本在单视角下于未见环境取得 4.45% 的成功率,使用多视角后进一步提升至 8.37%。

关键词

引用

@article{arxiv.2106.00596,
  title  = {Look Wide and Interpret Twice: Improving Performance on Interactive Instruction-following Tasks},
  author = {Van-Quang Nguyen and Masanori Suganuma and Takayuki Okatani},
  journal= {arXiv preprint arXiv:2106.00596},
  year   = {2021}
}

备注

To appear in IJCAI2021. 8-page main paper and Appendix following. Appendix E for details of entry submission to EAI 2021. Github: https://github.com/davidnvq/lwit-alfred