基于多模态 3D 场景图的零样态机械臂导航
计算机视觉与模式识别
2026-03-18 v5 机器人学
摘要
机械臂导航是机器人代理 operating 的基本能力。实际部署需要开放词汇泛化和低训练开销,激励使用零样态方法而非任务特定强化学习训练。然而,现有基于显式 3D 场景图的零样态方法常将丰富的视觉观察压缩为文本关系,导致构建成本高、视觉证据不可逆损失以及词汇受限。为此,我们提出了多模态 3D 场景图(M3DSG),通过替换文本关系边为动态分配的图像来保留视觉线索。在 M3DSG 基础上,我们提出了 MSGNav,一个零样态导航系统,包括用于高效推理的关键子图选择模块、用于开放词汇支持的自适应词汇更新模块以及用于准确探索推理的闭环推理模块。此外,我们进一步识别了零样态导航中的最后一公里问题——确定可行目标位置的合适最终视点——并提出了基于可见性的视点决策模块以显式解决。全面的实验结果表明,MSGNav 在具有挑战性的 GOAT-Bench 和 HM3D-ObjNav 基准上实现了最先进的性能。代码将在 https://github.com/ylwhxht/MSGNav 上公开。
引用
@article{arxiv.2511.10376,
title = {MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation},
author = {Xun Huang and Shijia Zhao and Yunxiang Wang and Xin Lu and Wanfa Zhang and Rongsheng Qu and Weixin Li and Yunhong Wang and Chenglu Wen},
journal= {arXiv preprint arXiv:2511.10376},
year = {2026}
}
备注
18 pages, Accepted by CVPR 2026