中文

利用 2D-VLM 实现无标签的大规模户外场景 3D 分段

计算机视觉与模式识别 2026-01-06 v1

摘要

本文提出了一种用于大规模点云数据的无需标注 3D 训练数据或配对 RGB 图像的 3D 语义分段方法。该方法通过虚拟相机将 3D 点云投影到 2D 图像上,并通过以自然语言提示为导向的基础 2D 模型进行语义分段。通过加权投票聚合来自多个视角的预测,实现 3D 分段。我们的方法在现有无训练方法中表现优异,分段精度与监督方法相当。此外,它支持开放词汇识别,使用户能够使用任意文本查询检测物体,从而克服传统监督方法的局限性。

关键词

引用

@article{arxiv.2601.02029,
  title  = {Leveraging 2D-VLM for Label-Free 3D Segmentation in Large-Scale Outdoor Scene Understanding},
  author = {Toshihiko Nishimura and Hirofumi Abe and Kazuhiko Murasaki and Taiga Yoshida and Ryuichi Tanida},
  journal= {arXiv preprint arXiv:2601.02029},
  year   = {2026}
}

备注

19