基于开放词典图像分割的伪标签生成的数据高效 3D 点云语义分割
计算机视觉与模式识别
2026-04-14 v1
摘要
3D 点云场景的语义分割是众多应用中的关键任务。在现实场景中,训练分割模型常面临三类数据不足:训练场景稀缺、点级标注稀缺以及缺乏用于重建的 2D 图像序列。现有的数据高效算法通常仅解决一个或两个挑战,尚未探索三者联合处理。本文提出一种数据高效训练框架,专为解决这三种数据不足而设计。我们提出的算法称为 Point pseudo-Labeling via Open-Vocabulary Image Segmentation (PLOVIS),利用开放词典图像分割 (OVIS) 模型作为伪标签生成器来弥补训练数据的不足。PLOVIS 直接从训练 3D 点云生成 2D 图像,用于伪标签生成,无需 2D 图像序列。为缓解伪标签中固有的噪声和类别不平衡,我们引入了两种阶段的伪标签过滤,结合类别平衡记忆库以进行有效训练。这种两种阶段的过滤机制首先去除低置信度伪标签,然后剔除可能错误的伪标签,从而提升伪标签质量。在四个基准数据集上(即 ScanNet、S3DIS、Toronto3D 和 Semantic3D)在现实数据稀缺条件下(仅几十个训练 3D 场景,每个场景仅标注 <100 个 3D 点)的实验表明,PLOVIS 在所有数据稀缺条件下均一致优于现有方法,包括标准微调策略和最新的弱监督学习算法。代码将公开提供。
引用
@article{arxiv.2604.11007,
title = {Data-Efficient Semantic Segmentation of 3D Point Clouds via Open-Vocabulary Image Segmentation-based Pseudo-Labeling},
author = {Takahiko Furuya},
journal= {arXiv preprint arXiv:2604.11007},
year = {2026}
}