基于视觉基础模型的细粒度图像到LiDAR对比蒸馏
计算机视觉与模式识别
2025-01-03 v3
摘要
对比性图像到LiDAR知识迁移常用于利用同步图像和点云学习3D表示,但常面临自冲突困境。该问题源于对比损失无意中解离了共享语义标签的不匹配点和像素的特征,损害了学习表示的完整性。为克服此问题,我们利用视觉基础模型(VFM)——它革新了像素级语义的获取——来增强3D表示学习。具体地,我们利用现成的VFM生成语义标签,用于弱监督的像素到点对比蒸馏。此外,我们采用von Mises-Fisher分布来结构化特征空间,确保同一类别内的语义嵌入在不同输入下保持一致。进一步,我们调整点的采样概率以解决空间分布和类别频率的不平衡,促进全面且平衡的学习。大量实验表明,我们的方法缓解了传统方法带来的挑战,并在下游任务中持续优于现有的图像到LiDAR对比蒸馏方法。源代码见https://github.com/Eaphan/OLIVINE。
引用
@article{arxiv.2405.14271,
title = {Fine-grained Image-to-LiDAR Contrastive Distillation with Visual Foundation Models},
author = {Yifan Zhang and Junhui Hou},
journal= {arXiv preprint arXiv:2405.14271},
year = {2025}
}
备注
Camera-ready version in NeurIPS 2024