VPN:视觉提示导航
计算机视觉与模式识别
2025-11-25 v6
摘要
虽然自然语言常用于引导具身智能体,但语言的固有歧义性和冗长性往往阻碍复杂环境中语言引导导航的效果。为此,我们提出了视觉提示导航(VPN)——一种新范式,通过仅使用用户提供的视觉提示来引导智能体在 2D 顶视图地图中导航。这种视觉提示主要聚焦于在场景的顶视视图上标记视觉导航轨迹,提供直观且以空间为依托的指导,而无需依赖语言指令。它更适合非专业用户,减少解释性歧义。我们在离散和连续导航设置中构建了 VPN 任务,分别通过扩展现有的 R2R 和 R2R-CE 剧集添加相应的视觉提示,构建了两个新数据集:R2R-VP 和 R2R-CE-VP。此外,我们引入了 VPNet,一个专门用于处理 VPN 任务的基线网络,包含两种数据增强策略:视角级增强(改变初始航向和提示方向)和轨迹级增强(整合来自大规模 3D 场景的多样化轨迹),以提升导航性能。广泛的实验评估了视觉提示形式、顶视图地图格式和数据增强策略对视觉提示导航性能的影响。代码已公开于 https://github.com/farlit/VPN。
引用
@article{arxiv.2508.01766,
title = {VPN: Visual Prompt Navigation},
author = {Shuo Feng and Zihan Wang and Yuchen Li and Rui Kong and Hengyi Cai and Shuaiqiang Wang and Gim Hee Lee and Piji Li and Shuqiang Jiang},
journal= {arXiv preprint arXiv:2508.01766},
year = {2025}
}
备注
Accepted by AAAI 2026