中文

面向视觉-语言导航的主动视觉信息收集

计算机视觉与模式识别 2020-08-21 v3

摘要

视觉-语言导航(VLN)是让智能体在照片级真实环境中执行导航指令的任务。VLN 的关键挑战之一是如何通过缓解由模糊指令和对环境观察不足所引起的不确定性来实现鲁棒导航。采用当前方法训练的智能体通常受此困扰,因而难以避免每一步的随机且低效的动作。相比之下,当人类面对此类挑战时,仍可通过主动探索周围环境以收集更多信息,从而维持鲁棒导航并作出更自信的导航决策。本工作受人类导航行为启发,赋予智能体主动信息收集能力,以构建更智能的视觉-语言导航策略。为此,我们提出一种端到端框架,用于学习探索策略,该策略决定 i) 何时及在何处探索,ii) 探索过程中哪些信息值得收集,以及 iii) 探索后如何调整导航决策。实验结果显示训练过程中涌现出了有前景的探索策略,并显著提升了导航性能。在 R2R 挑战排行榜上,我们的智能体在全部三种 VLN 设定(即单次运行、预探索与束搜索)下均取得了有前景的结果。

关键词

引用

@article{arxiv.2007.08037,
  title  = {Active Visual Information Gathering for Vision-Language Navigation},
  author = {Hanqing Wang and Wenguan Wang and Tianmin Shu and Wei Liang and Jianbing Shen},
  journal= {arXiv preprint arXiv:2007.08037},
  year   = {2020}
}

备注

ECCV2020 (changed with improved perfromance on Pre-Explore and Beam Search settings); website: https://github.com/HanqingWangAI/Active_VLN