中文

基于随机环境混合的视觉语言导航

计算机视觉与模式识别 2021-11-02 v3

摘要

视觉语言导航(Vision-Language Navigation, VLN)任务要求智能体在逐步导航的同时感知视觉观测并理解自然语言指令。由小规模数据与庞大导航空间之间的比例失衡所导致的数据偏差,使 VLN 任务极具挑战性。已有研究提出了多种数据增强方法来降低数据偏差,但这些工作并未显式地减少不同房屋场景间的数据偏差,因此智能体会过拟合于已见场景,在未见场景上导航性能较差。为解决该问题,我们提出随机环境混合(Random Environmental Mixup, REM)方法,通过混合环境生成跨连接的房屋场景作为增强数据。具体而言,我们首先依据房间连接图为每个场景选取关键视点,然后将不同场景的关键视图跨连接以构建增强场景,最后在跨连接场景中生成增强的指令-路径对。在基准数据集上的实验结果表明,经由 REM 得到的增强数据有助于智能体缩小已见与未见环境间的性能差距并提升整体表现,使我们的模型成为标准 VLN 基准上现有最佳方法。代码已发布:https://github.com/LCFractal/VLNREM。

关键词

引用

@article{arxiv.2106.07876,
  title  = {Vision-Language Navigation with Random Environmental Mixup},
  author = {Chong Liu and Fengda Zhu and Xiaojun Chang and Xiaodan Liang and Zongyuan Ge and Yi-Dong Shen},
  journal= {arXiv preprint arXiv:2106.07876},
  year   = {2021}
}

备注

ICCV 2021