中文

用于视觉语言导航的细粒度指令引导图推理

计算机视觉与模式识别 2025-12-24 v2 人工智能

摘要

视觉语言导航(VLN)要求具身智能体通过遵循自然语言指令在复杂环境中穿行,这要求视觉观察和语言引导之间的精确对齐。尽管最近取得了进展,但现有方法通常以耦合的方式编码视觉和方向线索,并且在处理指令时没有显式提取对导航至关重要的语义,这通常导致不精确的空间推理和次优的跨模态对齐。为了应对这些挑战,我们提出了一种细粒度指令引导图推理框架(OIKG),该框架在导航过程中增强了空间表征和指令理解。具体而言,引入了一种观察图交互机制,在通过几何嵌入加强有向边表征的同时解耦角度和视觉线索,从而在导航图中实现更可靠的空间推理。此外,设计了一个细粒度指令引导模块,以显式提取并利用语言指令中特定于位置和以目标为中心的信息,促进语言语义与可导航轨迹之间更精确的跨模态对齐。通过将结构化图推理与指令关键语义线索联合集成,所提出的方法显著提高了智能体遵循复杂导航指令的能力。在 R2R 和 RxR 基准上的大量实验表明,我们的方法在多个评估指标上始终实现 SOTA 性能,验证了细粒度指令引导图推理对视觉语言导航的有效性。

关键词

引用

@article{arxiv.2503.11006,
  title  = {Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation},
  author = {Yaohua Liu and Xinyuan Song and Yunfu Deng and Yifan Xie and Binkai Ou and Yan Zhong},
  journal= {arXiv preprint arXiv:2503.11006},
  year   = {2025}
}

备注

10 pages, 4 figures