P$^{3}$Nav:面向视觉-语言导航的端到端感知、预测与规划
机器人学
2026-03-19 v1
摘要
在视觉-语言导航(VLN)中,智能体需要使用其视觉观察来规划通往由语言指令指定的目标的路径。因此,现有的 VLN 方法主要侧重于通过视觉-文本对齐构建强大的规划器,但这些方法往往绕过了规划前的全面场景理解要求,导致智能体缺乏充分的感知或预测能力。因此,我们提出了 PNav,一种集成感知、预测与规划的新型端到端框架,以强化 VLN 智能体的场景理解并提升导航成功率。具体而言,PNav 通过从对象级和地图级视角中提取互补线索来增强感知;随后,PNav 预测路标点来建模智能体的潜在未来状态,使智能体在导航期间对候选位置具有内在意识;在这些未来路标点条件下,PNav 进一步预测语义地图线索,实现主动规划,减少对纯历史上下文的严格依赖。整合这些感知和预测线索,PNav 的综合规划模块最终完成 VLN 任务。广泛的实验表明,我们的 PNav 在 REVERIE、R2R-CE 和 RxR-CE 数据集上实现了新的状态-of-the-art 性能。
引用
@article{arxiv.2603.17459,
title = {P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation},
author = {Tianfu Li and Wenbo Chen and Haoxuan Xu and Xinhu Zheng and Haoang Li},
journal= {arXiv preprint arXiv:2603.17459},
year = {2026}
}