中文

通过跨架构知识蒸馏推广 CNN 以提高高效单目深度估计

计算机视觉与模式识别 2024-04-26 v1

摘要

最近,单目深度估计 (MDE) 的性能显著提升,主要归功于融合转换模型。然而,转换模型通常计算昂贵,且在轻量级模型中的有效性有限于卷积。这种限制阻碍了其在资源受限设备上的部署。本文提出一种跨架构知识蒸馏方法用于 MDE,称为 DisDepth,以增强高效 CNN 模型以接收最先进转换模型的监督。具体而言,我们首先构建一个基于卷积的 MDE 框架,然后通过引入新颖的局部-全局卷积模块来捕获图像中的局部和全局信息。为有效地从转换教师蒸馏有价值信息并弥合卷积与转换特征之间的差距,我们引入一种方法,使教师适应一个幽灵解码器。幽灵解码器是学生解码器的副本,通过使教师适应幽灵解码器来对齐特征,使其更符合学生的需求,同时保持其原始性能。此外,我们提出了注意力知识蒸馏损失,以适应性地识别有价值的特征。该损失引导学生关注注意力区域,从而提高其性能。在 KITTI 和 NYU Depth V2 数据集上的大量实验表明,DisDepth 的有效性。我们的方法在各种高效主干网络上均实现了显著提升,展现了其在高效单目深度估计中的潜力。

关键词

引用

@article{arxiv.2404.16386,
  title  = {Promoting CNNs with Cross-Architecture Knowledge Distillation for Efficient Monocular Depth Estimation},
  author = {Zhimeng Zheng and Tao Huang and Gongsheng Li and Zuyi Wang},
  journal= {arXiv preprint arXiv:2404.16386},
  year   = {2024}
}