中文

Narrate2Nav:基于隐式语言推理的实时人类导向环境视觉导航

机器人学 2025-06-18 v1

摘要

大型视觉语言模型(VLM)已展示出在人类导向环境中通过理解情境线索、人类意图和社交动态并展现推理能力来增强移动机器人导航的潜力。然而,他们的计算复杂度和对连续数值数据的敏感性有限,妨碍了实时性能和精确运动控制。为此,我们提出Narrate2Nav,一种新型实时视觉-动作模型,利用基于Barlow Twins冗余减少损失的自监督学习框架,将隐式自然语言推理、社交线索和人类意图嵌入视觉编码器中,使模型能在潜在空间中进行推理而非标记空间。该模型在训练期间组合RGB输入、运动指令和场景上下文文本信号,以桥接机器人观测与部署期间进行短视野点目标导航的低层运动指令。对Narrate2Nav在离线未见数据集和真实世界实验中各种具有挑战性情景的广泛评估显示,分别相对于下一最佳基线实现了52.94%和41.67%的整体提升。此外,Narrate2Nav视觉编码器注意力图与四个其他基线方法的定性比较分析显示,其对导航关键场景要素的注意力更强,凸显了其在人类导向导航任务中的有效性。

关键词

引用

@article{arxiv.2506.14233,
  title  = {Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments},
  author = {Amirreza Payandeh and Anuj Pokhrel and Daeun Song and Marcos Zampieri and Xuesu Xiao},
  journal= {arXiv preprint arXiv:2506.14233},
  year   = {2025}
}