面向无监督激光雷达语义分割的跨模态与跨域学习
计算机视觉与模式识别
2023-08-08 v1
摘要
近年来,跨模态域适应已在配对的 2D 图像与 3D LiDAR 数据上得到研究,以缓解目标域中 3D LiDAR 语义分割(3DLSS)的标注成本。然而,在此设定下,源域中配对的 2D 与 3D 数据仍需额外采集。由于 2D-3D 投影可使 3D 模型从 2D 对应数据中学习语义信息,我们探讨能否进一步去除对源域 3D 数据的需求,仅依赖源域 2D 图像。为回答此问题,本文研究一种新的 3DLSS 设定:存在一个带语义标注的 2D 数据集(源域)以及配对的但未标注的 2D 图像与 3D LiDAR 数据(目标域)。为在该场景下实现 3DLSS,我们提出跨模态与跨域学习(CoMoDaL)。具体而言,我们的 CoMoDaL 旨在建模 1)未配对的源域 2D 图像与目标域 3D LiDAR 数据之间的模态间跨域蒸馏,以及 2)目标域 2D 图像与 3D LiDAR 数据对之间的域内跨模态引导。在 CoMoDaL 中,我们提出施加若干约束,如点对面与原型对面的对齐,通过构建两种模态下的混合样本来关联不同模态与域间的语义。在多个数据集上的实验结果表明,在所提设定下,所开发的 CoMoDaL 可在无标注 LiDAR 数据监督的情况下实现分割。我们还进行了消融实验以提供更多分析。代码将公开可用。
引用
@article{arxiv.2308.02883,
title = {Cross-modal & Cross-domain Learning for Unsupervised LiDAR Semantic Segmentation},
author = {Yiyang Chen and Shanshan Zhao and Changxing Ding and Liyao Tang and Chaoyue Wang and Dacheng Tao},
journal= {arXiv preprint arXiv:2308.02883},
year = {2023}
}
备注
Accepted by ACM Multimedia 2023