中文

眼见为实?利用视觉扰动增强视觉语言导航

计算机视觉与模式识别 2025-04-08 v2

摘要

在具身环境中由自然语言指令引导的自主导航对视觉语言导航(VLN)智能体而言仍是一项挑战。尽管在学习多样且细粒度的视觉环境表示方面取得的最新进展展现出了前景,但脆弱的性能提升可能并不能确切归因于视觉基础(visual grounding)的增强,这一局限性在相关的视觉语言任务中也有所观察。在本工作中,我们通过引入不同级别的视觉扰动,初步研究了先进的 VLN 模型是否真正理解其环境的视觉内容。这些扰动包括真实深度图像、扰动视图和随机噪声。令人惊讶的是,我们在实验中发现,简单的分支扩展,即使带有含噪视觉输入,反而出人意料地提高了导航效率。受这些见解启发,我们进一步提出了一种通用的多分支架构(MBA),旨在深入探究分支数量和视觉质量的影响。所提出的 MBA 将基础智能体扩展为多分支变体,其中每个分支处理不同的视觉输入。这种方法极其简单,且对基于拓扑的 VLN 智能体具有通用性。在三个 VLN 基准(R2R、REVERIE、SOON)上的大量实验表明,我们采用最优视觉排列的方法匹配甚至超越了当前最优结果。源代码可在此处获取。

关键词

引用

@article{arxiv.2409.05552,
  title  = {Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations},
  author = {Xuesong Zhang and Jia Li and Yunbo Xu and Zhenzhen Hu and Richang Hong},
  journal= {arXiv preprint arXiv:2409.05552},
  year   = {2025}
}

备注

8 pages, 5 figures, accepted at IJCNN 2025