中文

深入探究自监督单目深度估计的泛化能力

计算机视觉与模式识别 2023-03-21 v3 人工智能

摘要

自监督单目深度估计近来已被广泛研究。大多数工作集中于提升在基准数据集(如 KITTI)上的性能,但对泛化性能的实验较少。本文中,我们针对单目深度估计的泛化能力考察了骨干网络(例如 CNN、Transformer 以及 CNN-Transformer 混合模型)。我们首先在多样化的公开数据集上评估最先进的模型,这些数据集在网络训练期间从未被见过。接下来,我们利用自行生成的各种纹理偏移数据集,考察了纹理偏置与形状偏置表征的影响。我们观察到 Transformer 表现出强烈的形状偏置,而 CNN 表现出强烈的纹理偏置。我们还发现,相比于纹理偏置模型,形状偏置模型在单目深度估计中展现出更好的泛化性能。基于这些观察,我们新设计了一个带有多级自适应特征融合模块的 CNN-Transformer 混合网络,称为 MonoFormer。MonoFormer 背后的设计直觉是通过使用 Transformer 来增强形状偏置,同时借助自适应融合多级表征来弥补 Transformer 较弱的局部性偏置。大量实验表明,所提方法在各种公开数据集上取得了最先进的性能。我们的方法在竞争方法中也展现出最佳的泛化能力。

关键词

引用

@article{arxiv.2205.11083,
  title  = {Deep Digging into the Generalization of Self-Supervised Monocular Depth Estimation},
  author = {Jinwoo Bae and Sungho Moon and Sunghoon Im},
  journal= {arXiv preprint arXiv:2205.11083},
  year   = {2023}
}

备注

Accepted to AAAI 2023