中文

DAP:面向视觉与语言导航的领域感知提示学习

计算机视觉与模式识别 2024-01-01 v4

摘要

遵循语言指令在未知环境中导航是自主具身智能体的一项具有挑战性的任务。凭借强大的表征能力,预训练的视觉与语言模型被广泛应用于视觉与语言导航(VLN)。然而,它们大多在网页爬取的通用数据集上训练,这导致在用于VLN任务时存在显著的领域鸿沟。为解决该问题,我们提出了一种新颖且模型无关的域感知提示学习(DAP)框架。为使预训练模型具备VLN任务中特定的物体级与场景级跨模态对齐能力,DAP采用低成本的提示调优范式,学习软视觉提示以提取领域内图像语义。具体而言,我们首先借助CLIP模型生成一组领域内图文对,然后在预训练模型视觉编码器的输入空间中引入软视觉提示。DAP以高效方式将领域内视觉知识注入预训练模型的视觉编码器。在R2R和REVERIE上的实验结果表明,与现有最先进(SOTA)方法相比,DAP具有优越性。

关键词

引用

@article{arxiv.2311.17812,
  title  = {DAP: Domain-aware Prompt Learning for Vision-and-Language Navigation},
  author = {Ting Liu and Yue Hu and Wansen Wu and Youkai Wang and Kai Xu and Quanjun Yin},
  journal= {arXiv preprint arXiv:2311.17812},
  year   = {2024}
}

备注

4 pages. arXiv admin note: substantial text overlap with arXiv:2309.03661