中文

OVER-NAV:以开放词汇检测与结构化表示提升迭代式视觉-语言导航

计算机视觉与模式识别 2024-03-27 v1

摘要

迭代式视觉-语言导航(IVLN)的最新进展通过在多轮场景巡游中保持智能体记忆,引入了一种更有意义且更实用的VLN范式。尽管长期记忆更符合VLN任务的持续性本质,但如何利用高度非结构化且监督极其稀疏的导航记忆,也带来了更多挑战。为此,我们提出OVER-NAV,旨在超越并突破当前IVLN技术的水平。具体而言,我们提出结合大语言模型(LLMs)与开放词汇检测器,以提炼关键信息并建立多模态信号间的对应关系。这种机制引入了可靠的跨模态监督,并能在无需额外标注和重新训练的情况下,即时泛化到未见过的场景。为充分利用经解释的导航数据,我们进一步引入一种结构化表示——编码全息图(coded Omnigraph),以有效整合巡游过程中的多模态信息。配合新颖的全息图融合机制,OVER-NAV能够从全息图中提取最相关的知识,以实现更精确的导航动作。此外,OVER-NAV在统一框架下无缝支持离散与连续环境。我们在大量实验中证明了OVER-NAV的优越性。

关键词

引用

@article{arxiv.2403.17334,
  title  = {OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation},
  author = {Ganlong Zhao and Guanbin Li and Weikai Chen and Yizhou Yu},
  journal= {arXiv preprint arXiv:2403.17334},
  year   = {2024}
}

备注

Accepted by CVPR 2024