利用 2D-VLM 实现无标签的大规模户外场景 3D 分段
计算机视觉与模式识别
2026-01-06 v1
摘要
本文提出了一种用于大规模点云数据的无需标注 3D 训练数据或配对 RGB 图像的 3D 语义分段方法。该方法通过虚拟相机将 3D 点云投影到 2D 图像上,并通过以自然语言提示为导向的基础 2D 模型进行语义分段。通过加权投票聚合来自多个视角的预测,实现 3D 分段。我们的方法在现有无训练方法中表现优异,分段精度与监督方法相当。此外,它支持开放词汇识别,使用户能够使用任意文本查询检测物体,从而克服传统监督方法的局限性。
引用
@article{arxiv.2601.02029,
title = {Leveraging 2D-VLM for Label-Free 3D Segmentation in Large-Scale Outdoor Scene Understanding},
author = {Toshihiko Nishimura and Hirofumi Abe and Kazuhiko Murasaki and Taiga Yoshida and Ryuichi Tanida},
journal= {arXiv preprint arXiv:2601.02029},
year = {2026}
}
备注
19