中文

面向视觉语言导航的开放集三维语义实例地图——O3D-SIM

计算机视觉与模式识别 2025-10-28 v2 机器人学

摘要

人类擅长形成其周围环境的心理地图,这使他们能够理解物体关系并基于语言查询进行导航。我们之前的工作 SI Maps (Nanwani L, Agarwal A, Jain K, et al. Instance-level semantic maps for vision language navigation. In: 2023 32nd IEEE International Conference on Robot and Human Interactive Communication (RO-MAN). IEEE; 2023 Aug.) 表明,拥有环境的实例级信息和语义理解有助于显著提升语言引导任务的性能。我们将这种实例级方法扩展到三维,同时提高了流程的鲁棒性并改进了定量和定性结果。我们的方法利用基础模型进行物体识别、图像分割和特征提取。我们提出了一种表示方法,生成带有实例级嵌入的三维点云地图,这些嵌入带来了自然语言命令可以查询的语义理解。在定量方面,该工作提高了语言引导任务的成功率。同时,我们定性地观察到更清晰地识别实例的能力,并利用基础模型以及语言和图像对齐的嵌入来识别那些否则封闭集方法无法识别的物体。项目页面 - https://smart-wheelchair-rrc.github.io/o3d-sim-webpage

关键词

引用

@article{arxiv.2404.17922,
  title  = {Open-Set 3D Semantic Instance Maps for Vision Language Navigation -- O3D-SIM},
  author = {Laksh Nanwani and Kumaraditya Gupta and Aditya Mathur and Swayam Agrawal and A. H. Abdul Hafez and K. Madhava Krishna},
  journal= {arXiv preprint arXiv:2404.17922},
  year   = {2025}
}