中文

TopV-Nav:解锁多模态大语言模型(MLLM)零样例目标导航中顶视空间推理潜能

计算机视觉与模式识别 2025-03-27 v2 人工智能 机器人学

摘要

零样例目标导航(ZSON)任务要求具身智能体在陌生环境中寻找之前未见过的目标对象。这种以目标为导向的探索高度依赖于感知、理解和基于环境空间信息进行推理的能力。然而,当前基于大语言模型的方法将视觉观察转换为语言描述,在语言空间中进行推理,导致空间信息丢失。本文引入 TopV-Nav,一种基于 MLLM 的方法,直接在具有充足空间信息的顶视图上进行推理。为充分发掘 MLLM 在顶视视角中的空间推理潜能,我们提出了自适应视觉提示生成(AVPG)方法,用于自适应构建语义丰富的顶视图。这使智能体能够直接利用顶视图中包含的空间信息进行深入推理。此外,我们设计了动态图缩放(DMS)机制,以在所需尺度动态放大顶视图,增强局部细粒度推理。我们还构思了潜在目标驱动(PTD)机制,以预测并利用目标位置,促进全局和类人探索。在 MP3D 和 HM3D 数据集上的实验表明,我们的 TopV-Nav 具有优势。

关键词

引用

@article{arxiv.2411.16425,
  title  = {TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation},
  author = {Linqing Zhong and Chen Gao and Zihan Ding and Yue Liao and Huimin Ma and Shifeng Zhang and Xu Zhou and Si Liu},
  journal= {arXiv preprint arXiv:2411.16425},
  year   = {2025}
}

备注

10 pages