中文

DSM:用于3D视觉定位的多样化语义地图构建

计算机视觉与模式识别 2025-10-15 v2 机器人学

摘要

有效的场景表示对于视觉定位能力至关重要,但现有方法在3D视觉定位领域常受限。它们要么仅关注几何和视觉线索,要么像传统3D场景图一样缺乏用于复杂推理的多维属性。为弥合这一差距,我们引入了多样化语义地图(DSM)框架,这是一个新的场景表示框架,通过将鲁棒的几何模型丰富化为包括外观、物理属性和功能感知等多种VLM派生语义,构成丰富的语义表示。首先在时序滑动窗口内融合多视角观测,构建DSM,创建持久且全面的世界模型。基于这一基础,我们提出DSM定位,将定位从自由形式的VLM查询转向对语义丰富地图上的结构化推理,显著提高准确性和可解释性。广泛的评估验证了我们方法的优越性。在ScanRefer基准上,DSM定位实现了59.06%的[email protected]总体准确率,超越其他方法10%。在语义分割方面,DSM达到67.93%的F-mIoU,超越所有基线,包括特权方法。此外,在物理机器人上成功部署用于复杂导航和抓取任务,确认了该框架在实际场景中的实用性。

关键词

引用

@article{arxiv.2504.08307,
  title  = {DSM: Constructing a Diverse Semantic Map for 3D Visual Grounding},
  author = {Qinghongbing Xie and Zijian Liang and Fuhao Li and Long Zeng},
  journal= {arXiv preprint arXiv:2504.08307},
  year   = {2025}
}

备注

8 pages, 6 figures, Project Page: https://binicey.github.io/DSM