中文

POINav:面向真实世界视觉-语言导航中的最终米数到达基准化与提升

机器人学 2026-05-28 v1 计算机视觉与模式识别

摘要

真实世界导航本质上由感兴趣点(POI)驱动,但精准抵达 POI 仍是关键的 final-meters 挑战。现有的视觉-语言导航(VLN)POI-目标基准往往 suffer 从粗糙细粒度或显著 sim-to-real 差距 due to 生成场景。为填补这一差距,我们提出 POINav-Bench,首个专为真实世界 POI-目标导航闭环评估设计的基准。它包含 11 个商业区域,基于真实场景捕获使用 3D 高斯溶解(3DGS)重建,总计覆盖 126,398 平方米,涵盖 163 个 distinct POI。凭借可遍历性感知标注和参考轨迹,POINav-Bench 实现了对真实、POI 丰富环境中导航代理的高保真评估。基于此,我们提出 POINav 大脑-动作框架,其中 Brain 模块进行 POI 导向推理,以指导 Action 模块预测连续路径点以实现真实世界执行。我们进一步策划了 POINav 数据集,包含 7 万对真实场景标志-入口配对。实验表明,我们的框架为实现真实世界 POI-目标导航的精细化提供了可行路径。

关键词

引用

@article{arxiv.2605.28237,
  title  = {POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation},
  author = {Ruiyan Gong and Meisheng Zhang and Yuxiang Zhao and Mingchao Sun and Yanfen Shen and Zedong Chu and Zhining Gu and Wei Guo and Xiaolong Cheng and Qiming Li and Kangning Niu and Yanqing Zhu and Xiaolong Wu and Tianlun Li and Mu Xu},
  journal= {arXiv preprint arXiv:2605.28237},
  year   = {2026}
}

备注

25 pages, 9 figures