中文

P2DNav: 零样图-语言导航的全景到俯视推理

计算机视觉与模式识别 2026-05-20 v1 人工智能

摘要

视觉-语言导航 (VLN) 需要具身智能体在未见环境中将自然语言指令 grounding 到可执行导航动作。现有零样方法通常依赖额外的 waypoint prediction 模块,这些模块常使高层次方向推理与细粒度局部 grounding 交织,导致决策错误且不稳定。本文提出P2DNav,一个用于零样视觉-语言导航的层次框架。P2DNav由三个核心组件构成:Panorama-to-Downview (P2D)、滑动窗口对话记忆 (SDM) 以及反思再定位机制 (RRM)。P2D显式将导航决策分解为两个阶段:全景方向选择和俯视局部 grounding。它首先从360{\deg}全景中选择与指令相关的方向,然后在该方向的下视RGB观察中预测像素级目标点。此外,SDM将导航历史组织为多轮对话上下文,并在滑动窗口内维护最近的视觉观察,以支持长程导航。RRM进一步通过评估基于下视观察的局部 grounding 可靠性,在必要时返回全景方向选择。在R2R-CE基准上进行实验,P2DNav在零样方法中取得了强劲表现。特别是,与基于waypoint和无waypoint的SOTA方法相比,P2DNav分别实现了146.6%和58.9%的SR提升,证明了P2D、SDM和RRM在零样VLN中的有效性。代码将公开发布。

关键词

引用

@article{arxiv.2605.19634,
  title  = {P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation},
  author = {Kai Sheng and Liuyi Wang and Haojie Dai and Jinlong Li and Yongrui Qin and Zongtao He and Chengju Liu and Qijun Chen},
  journal= {arXiv preprint arXiv:2605.19634},
  year   = {2026}
}