中文

面向视觉与语言导航的基于提示的上下文与域感知预训练

计算机视觉与模式识别 2023-12-15 v3

摘要

预训练的视觉-语言模型具有广泛的世界知识,并广泛用于视觉与语言导航(VLN)。然而,它们对 VLN 任务的室内场景不敏感。VLN 的另一个挑战是智能体如何理解路径上动作间的上下文关系并顺序执行跨模态对齐。本文中,我们提出一种新颖的基于提示的上下文与室内感知(PANDA)预训练框架以解决这些问题。它在两个阶段执行提示。在室内感知阶段,我们应用高效的调优范式从室内数据集中学习深度视觉提示,以增强预训练模型对室内环境的归纳偏置。这能为 VLN 智能体实现更具样本效率的适配。此外,在上下文感知阶段,我们设计了一组困难上下文提示以捕获指令中的序列级语义。它们通过对比学习实现对预训练模型的进一步调优。在 R2R 和 REVERIE 上的实验结果均显示了 PANDA 相对于现有 state-of-the-art 方法的优越性。

关键词

引用

@article{arxiv.2309.03661,
  title  = {Prompt-based Context- and Domain-aware Pretraining for Vision and Language Navigation},
  author = {Ting Liu and Yue Hu and Wansen Wu and Youkai Wang and Kai Xu and Quanjun Yin},
  journal= {arXiv preprint arXiv:2309.03661},
  year   = {2023}
}

备注

12 pages