中文

基于因果的跨模态表示学习用于视觉 - 语言导航

计算机视觉与模式识别 2024-03-07 v1

摘要

视觉 - 语言导航(VLN)因其在现实场景中的潜在应用,近年来引起了广泛的研究兴趣。然而,现有的 VLN 方法难以解决虚假关联问题,导致泛化能力较差,在可见环境与不可见环境之间存在显著的性能差距。在本文中,我们通过提出一个基于因果学习范式的统一框架 CausalVLN 来应对这一挑战,旨在训练能够学习无偏特征表示的鲁棒导航器。具体而言,我们利用结构化因果模型(SCM)对 VLN 中的视觉和语言混淆因子建立了合理的假设。在此基础上,我们提出了一种基于迭代后门表示学习(IBRL)的方法,允许对混淆因子进行自适应且有效的干预。此外,我们引入了视觉和语言后门因果编码器,以在训练和验证期间实现多模态的无偏特征表达,从而增强智能体在不同环境间的泛化能力。在三个 VLN 数据集(R2R、RxR 和 REVERIE)上的实验表明,我们提出的方法优于以往的 SOTA 方法。此外,详细的可视化分析证明了 CausalVLN 在显著缩小可见与不可见环境之间性能差距方面的有效性,突显了其强大的泛化能力。

关键词

引用

@article{arxiv.2403.03405,
  title  = {Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation},
  author = {Liuyi Wang and Zongtao He and Ronghao Dang and Huiyi Chen and Chengju Liu and Qijun Chen},
  journal= {arXiv preprint arXiv:2403.03405},
  year   = {2024}
}

备注

16 pages