Drive&Segment:基于跨模态蒸馏的城市场景无监督语义分割
计算机视觉与模式识别
2024-02-22 v2
摘要
本工作研究在城市场景中无需任何人工标注地学习像素级语义图像分割,仅使用由装备相机与 LiDAR 传感器、绕城市行驶的汽车所采集的原始未筛选数据。我们的贡献有三方面。首先,我们提出一种利用同步 LiDAR 与图像数据进行跨模态无监督语义图像分割学习的新方法。我们方法的关键要素是使用一个对象提议模块分析 LiDAR 点云以获得空间一致对象的提议。其次,我们展示这些 3D 对象提议可与输入图像对齐并可靠地聚类为语义有意义的伪类别。最后,我们开发了一种跨模态蒸馏方法,利用以所得伪类别部分标注的图像数据训练基于 transformer 的模型用于图像语义分割。我们通过在四个不同测试数据集(Cityscapes、Dark Zurich、Nighttime Driving 与 ACDC)上无需任何微调进行测试展示了方法的泛化能力,并证明相比该问题的当前最先进水平有显著改进。参见项目网页 https://vobecant.github.io/DriveAndSegment/ 获取代码与更多信息。
引用
@article{arxiv.2203.11160,
title = {Drive&Segment: Unsupervised Semantic Segmentation of Urban Scenes via Cross-modal Distillation},
author = {Antonin Vobecky and David Hurych and Oriane Siméoni and Spyros Gidaris and Andrei Bursuc and Patrick Pérez and Josef Sivic},
journal= {arXiv preprint arXiv:2203.11160},
year = {2024}
}
备注
v2: improved quality of images. See the project webpage https://vobecant.github.io/DriveAndSegment/ for the code and more