LOSC:激光点云开放词语分割整合器
计算机视觉与模式识别
2026-03-17 v2
摘要
我们研究了利用基于图像的视觉语言模型(Vision-Language Models, VLMs)对驾驶场景中的激光点云进行零射开放词汇分割的问题。经典方法可将图像语义投影到3D点云上,但生成的点标签往往噪声大且稀疏。我们对这些标签进行整合,以实现时空一致性和对图像级增强的鲁棒性。随后,我们基于这些精炼后的标签训练3D网络。这种简单的方法称为 LOSC,显著优于在 nuScenes 和 SemanticKITTI 上实现的零射开放词汇语义和全景分割的最先进技术。代码已公开于 https://github.com/valeoai/LOSC。
引用
@article{arxiv.2507.07605,
title = {LOSC: LiDAR Open-voc Segmentation Consolidator},
author = {Nermin Samet and Gilles Puy and Renaud Marlet},
journal= {arXiv preprint arXiv:2507.07605},
year = {2026}
}
备注
3DV 2026, Oral