中文

Lite-Mono:一种用于自监督单目深度估计的轻量 CNN 与 Transformer 架构

计算机视觉与模式识别 2023-03-16 v2

摘要

无需真实标签进行训练的自监督单目深度估计近年来备受关注。设计轻量且有效的模型以便部署于边缘设备具有高度价值。许多现有架构以更大的模型尺寸为代价受益于更重的主干网络。本文以轻量架构取得了可比的结果。具体而言,研究了 CNN 与 Transformer 的高效组合,并提出了一种称为 Lite-Mono 的混合架构。提出了连续空洞卷积(CDC)模块与局部-全局特征交互(LGFI)模块。前者用于提取丰富的多尺度局部特征,后者利用自注意力机制将长程全局信息编码入特征中。实验表明,Lite-Mono 在精度上大幅优于 Monodepth2,且可训练参数减少约 80%。

引用

@article{arxiv.2211.13202,
  title  = {Lite-Mono: A Lightweight CNN and Transformer Architecture for Self-Supervised Monocular Depth Estimation},
  author = {Ning Zhang and Francesco Nex and George Vosselman and Norman Kerle},
  journal= {arXiv preprint arXiv:2211.13202},
  year   = {2023}
}

备注

Accepted to CVPR2023