中文

用于细粒度深度完成的单目基础模型蒸馏

计算机视觉与模式识别 2025-03-24 v1

摘要

深度完成涉及从稀疏LiDAR输入预测稠密深度图。然而,来自传感器的稀疏深度标注限制了稠密监督的可用性,这对于学习详细几何特征至关重要。本文提出了一个两阶段知识蒸馏框架,利用强大的单目基础模型为深度完成提供稠密监督。在第一阶段,我们引入一种预训练策略,从自然图像中生成多样化的训练数据,这将几何知识蒸馏到深度完成。具体而言,我们通过利用单目深度和网格重建来模拟LiDAR扫描,从而创建无需真实深度的训练数据。此外,单目深度估计在现实场景中存在尺度歧义。为此,在第二阶段,我们采用尺度和平移不变损失(SSI Loss)来学习真实世界尺度。我们的两阶段蒸馏框架使深度完成模型能够充分利用单目基础模型的优势。实验结果表明,使用我们两阶段蒸馏框架训练的模型在KITTI基准测试中取得最先进的性能,名列第一。代码已公开:https://github.com/Sharpiless/DMD3C

关键词

引用

@article{arxiv.2503.16970,
  title  = {Distilling Monocular Foundation Model for Fine-grained Depth Completion},
  author = {Yingping Liang and Yutao Hu and Wenqi Shao and Ying Fu},
  journal= {arXiv preprint arXiv:2503.16970},
  year   = {2025}
}