中文

LOSC:激光点云开放词语分割整合器

计算机视觉与模式识别 2026-03-17 v2

摘要

我们研究了利用基于图像的视觉语言模型(Vision-Language Models, VLMs)对驾驶场景中的激光点云进行零射开放词汇分割的问题。经典方法可将图像语义投影到3D点云上,但生成的点标签往往噪声大且稀疏。我们对这些标签进行整合,以实现时空一致性和对图像级增强的鲁棒性。随后,我们基于这些精炼后的标签训练3D网络。这种简单的方法称为 LOSC,显著优于在 nuScenes 和 SemanticKITTI 上实现的零射开放词汇语义和全景分割的最先进技术。代码已公开于 https://github.com/valeoai/LOSC。

关键词

引用

@article{arxiv.2507.07605,
  title  = {LOSC: LiDAR Open-voc Segmentation Consolidator},
  author = {Nermin Samet and Gilles Puy and Renaud Marlet},
  journal= {arXiv preprint arXiv:2507.07605},
  year   = {2026}
}

备注

3DV 2026, Oral