中文

ELiTe:高效图像到激光雷达知识传递用于语义分割

计算机视觉与模式识别 2024-05-08 v1

摘要

跨模态知识传递增强了激光雷达语义分割中点云表示学习的能力。尽管存在潜力,但「弱教师挑战」因重复且非多样化的汽车摄像图像以及稀疏且不准确的地面真实标签而出现。为此,我们提出了高效图像到激光雷达知识传递(ELiTe)范式。ELiTe引入基于补丁到点的多阶段知识蒸馏,从Vision Foundation Model(VFM)那里传递全面知识,VFM在广泛的开放世界图像上进行过大规模训练。这使得跨模态向轻量级学生模型有效传递知识成为可能。ELiTe采用参数高效微调来强化VFM教师并以最小成本加速大规模模型训练。此外,我们引入基于Segment Anything Model的伪标签生成方法以增强低质量图像标签,促进稳健的语义表示。ELiTe中的高效知识传递在SemanticKITTI基准测试上实现了最先进的结果,超越了实时推理模型。我们的做法以显著更少的参数实现了这一目标,证明了其有效性和效率。

关键词

引用

@article{arxiv.2405.04121,
  title  = {ELiTe: Efficient Image-to-LiDAR Knowledge Transfer for Semantic Segmentation},
  author = {Zhibo Zhang and Ximing Yang and Weizhong Zhang and Cheng Jin},
  journal= {arXiv preprint arXiv:2405.04121},
  year   = {2024}
}

备注

9 pages, 6 figures, ICME 2024 oral