中文

基于域适应的跨模态知识蒸馏用于3D语义分割

计算机视觉与模式识别 2025-09-16 v1 机器人学

摘要

3D LiDAR 数据的语义分割在自动驾驶中发挥着关键作用。传统方法依赖大量标注数据进行点云分析,造成高昂成本和时间投入。相比之下,现实世界图像数据集提供了丰富的可用性和巨大的规模。为缓解对3D LiDAR 点云标注的负担,我们提出了两种跨模态知识蒸馏方法:基于域适应的无监督域适应知识蒸馏(UDAKD)和基于特征和语义的知识蒸馏(FSKD)。利用自动驾驶场景中摄像机和 LiDAR 的可获得的时空同步数据,我们直接将预训练的2D图像模型应用于无标签2D数据。通过已知的2D-3D对应关系进行跨模态知识蒸馏,我们主动对齐3D网络的输出与相应2D网络的点,以此无需3D标注。我们的工作重点是在跨模态蒸馏期间保留模态通用信息的同时过滤掉模态特定细节。为实现这一目标,我们在3D点云上部署自校准卷积作为域适应模块的基础。严格的实验验证了我们提出方法的有效性,始终在该领域的前沿方法中取得优异性能。

关键词

引用

@article{arxiv.2509.00379,
  title  = {Domain Adaptation-Based Crossmodal Knowledge Distillation for 3D Semantic Segmentation},
  author = {Jialiang Kang and Jiawen Wang and Dingsheng Luo},
  journal= {arXiv preprint arXiv:2509.00379},
  year   = {2025}
}

备注

ICRA 2025