中文

$NavA^3$: 理解任意指令,导航至任何位置,寻找任何目标

机器人学 2025-08-07 v1

摘要

具身导航是具身智能的基本能力,使机器人能够在物理环境中移动和交互。然而,现有的导航任务主要关注预定义的对象导航或指令跟随,这与实际场景中涉及复杂、开放场景的人类需求有很大差异。为弥合这一差距,我们引入了一个具有挑战性的长期程度导航任务,需要理解高层次人类指令并在真实环境中执行具有空间感知的对象导航。现有的具身导航方法由于难以理解高层次人类指令和以开放词汇表定位对象而在此类任务上受限。本文提出了 NavA3NavA^3,一个分为两个阶段(全局与局部)的层次化框架。在全局策略中,我们利用推理能力强的 Reasoning-VLM 解析高层次人类指令,并将其与全局 3D 场景视图集成,从而进行推理并导航至最可能包含目标对象的区域。在局部策略中,我们收集了 100 万样本的空间感知对象 affordance 数据集,以训练 NaviAfford 模型(PointingVLM),该模型为在复杂环境中实现精确的目标识别和导航提供了稳健的开放词汇对象定位和空间感知能力。大量实验表明,NavA3NavA^3 在导航性能上实现了 SOTA 结果,并能在不同机器人本体 embodiment 在真实场景中成功完成长期程度导航任务,为通用具身导航铺平了道路。该数据集和代码将公开。项目网站: https://NavigationA3.github.io/。

关键词

引用

@article{arxiv.2508.04598,
  title  = {$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything},
  author = {Lingfeng Zhang and Xiaoshuai Hao and Yingbo Tang and Haoxiang Fu and Xinyu Zheng and Pengwei Wang and Zhongyuan Wang and Wenbo Ding and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2508.04598},
  year   = {2025}
}