中文

面向视觉与语言导航的未见差异预判

计算机视觉与模式识别 2022-09-13 v1 计算与语言

摘要

视觉-语言导航要求智能体遵循自然语言指令到达特定目标。可见与未见环境之间的巨大差异使得智能体难以良好泛化。已有研究提出数据增强方法以显式或隐式缓解数据偏差,并带来泛化能力的提升。然而,它们试图记忆增强后的轨迹,却忽略了测试时未见环境下的分布偏移。本文提出一种未见差异预判视觉与语言导航(DAVIS)方法,通过学习鼓励测试时视觉一致性来泛化至未见环境。具体而言,我们设计了:1)一种利用跨相似语义观测的视觉一致性信号的半监督框架 DAVIS;2)一个鼓励适应测试时分布的两阶段学习过程。该框架以 Momentum Contrast 增强基本的模仿与强化学习混合方法,以在联合训练阶段与测试时适应阶段鼓励相似观测下的稳定决策。大量实验表明,DAVIS 在 R2R 与 RxR 基准上相较先前最优 VLN 基线取得了模型无关的改进。我们的源代码与数据见补充材料。

关键词

引用

@article{arxiv.2209.04725,
  title  = {Anticipating the Unseen Discrepancy for Vision and Language Navigation},
  author = {Yujie Lu and Huiliang Zhang and Ping Nie and Weixi Feng and Wenda Xu and Xin Eric Wang and William Yang Wang},
  journal= {arXiv preprint arXiv:2209.04725},
  year   = {2022}
}