中文

基于因果学习的视觉与语言导航

计算机视觉与模式识别 2024-04-17 v1 人工智能

摘要

在追求鲁棒且可泛化的环境感知与语言理解的过程中,数据集偏差这一普遍挑战持续困扰着视觉与语言导航(VLN)智能体,阻碍其在未见环境中的表现。本文介绍了广义跨模态因果Transformer(GOAT),这是一种根植于因果推断范式的开创性解决方案。通过深入研究视觉、语言和历史中的可观测与不可观测混杂因素,我们提出了后门调整和前门调整因果学习(BACL和FACL)模块,通过全面减轻潜在的虚假相关性来促进无偏学习。此外,为了捕获全局混杂特征,我们提出了一个由对比学习监督的跨模态特征池化(CFP)模块,该模块也被证明在预训练期间能有效改善跨模态表示。在多个VLN数据集(R2R、REVERIE、RxR和SOON)上的大量实验,突显了我们提出的方法相较于先前最先进方法的优越性。代码可在 https://github.com/CrystalSixone/VLN-GOAT 获取。

关键词

引用

@article{arxiv.2404.10241,
  title  = {Vision-and-Language Navigation via Causal Learning},
  author = {Liuyi Wang and Zongtao He and Ronghao Dang and Mengjiao Shen and Chengju Liu and Qijun Chen},
  journal= {arXiv preprint arXiv:2404.10241},
  year   = {2024}
}