IGLOSS:基于图像生成的激光雷达开放词汇语义分割
计算机视觉与模式识别
2026-04-03 v1
摘要
本文提出了一种新的方法,用于 3D 自动驾驶激光雷达数据的零样态开放词汇语义分割(OVSS)。为规克基于视觉语言模型(如 CLIP)的方法固有的图像-文本模态差距,我们的方法依赖于从文本生成图像,以创建原型图像。给定从 2D 视觉基础模型(VFM) distilled 的 3D 网络后,我们通过匹配 3D 点特征与这些原型图像的 2D 图像特征来对点云进行标记。我们的方法在 nuScenes 和 SemanticKITTI 上的 OVSS 表现为最先进。代码、预训练模型和生成的图像均可在 https://github.com/valeoai/IGLOSS 上获取。
引用
@article{arxiv.2604.01361,
title = {IGLOSS: Image Generation for Lidar Open-vocabulary Semantic Segmentation},
author = {Nermin Samet and Gilles Puy and Renaud Marlet},
journal= {arXiv preprint arXiv:2604.01361},
year = {2026}
}