中文

战术回退:视觉与语言导航中通过回溯实现自我纠正

计算与语言 2019-04-03 v2 计算机视觉与模式识别 机器学习 神经与进化计算 机器人学

摘要

我们提出具有回溯的边界感知搜索(FAST)导航器,一种用于动作解码的通用框架,在Anderson等人(2018)的Room-to-Room(R2R)视觉与语言导航挑战上取得了最先进的结果。给定自然语言指令和此前未见环境的照片级真实图像视角,智能体被要求尽快从源位置导航至目标位置。虽然当前所有方法都通过束搜索进行局部动作决策或对整个轨迹评分,我们的方法在探索未观测环境时平衡了局部与全局信号。重要的是,这使我们能够贪婪行动,但在必要时利用全局信号回溯。将FAST框架应用于现有最先进模型取得了17%的相对提升,即按路径长度加权的成功率(SPL)上6%的绝对提升。

关键词

引用

@article{arxiv.1903.02547,
  title  = {Tactical Rewind: Self-Correction via Backtracking in Vision-and-Language Navigation},
  author = {Liyiming Ke and Xiujun Li and Yonatan Bisk and Ari Holtzman and Zhe Gan and Jingjing Liu and Jianfeng Gao and Yejin Choi and Siddhartha Srinivasa},
  journal= {arXiv preprint arXiv:1903.02547},
  year   = {2019}
}

备注

CVPR 2019 Oral, video demo: https://youtu.be/AD9TNohXoPA