中文

SwinDepth:基于 Swin Transformer 与密集级联网络的单目序列无监督深度估计

计算机视觉与模式识别 2023-01-18 v1 机器学习 机器人学

摘要

单目深度估计在定位、建图和 3D 目标检测等各种计算机视觉与机器人应用中发挥着关键作用。近年来,基于学习的算法通过以监督方式用大量数据训练模型,在深度估计方面取得了巨大成功。然而,获取用于监督训练的密集真值深度标签极具挑战性,因此利用单目序列的无监督深度估计成为一种极具前景的替代方案。遗憾的是,大多数关于无监督深度估计的研究探索的是损失函数或遮挡掩码,而模型架构几乎没有变化,因为基于 ConvNet 的编码器-解码器结构已成为深度估计的事实标准。在本文中,我们采用无卷积的 Swin Transformer 作为图像特征提取器,使网络能够同时捕获用于深度估计的局部几何特征和全局语义特征。此外,我们提出了一种密集级联多尺度网络(DCMNet),通过自顶向下的级联路径将每个特征图与来自不同尺度的另一个特征图直接连接。这种密集级联连接增强了解码层之间的互连,并产生高质量的多尺度深度输出。在 KITTI 和 Make3D 两个不同数据集上的实验表明,我们提出的方法优于现有的 SOTA 无监督算法。

关键词

引用

@article{arxiv.2301.06715,
  title  = {SwinDepth: Unsupervised Depth Estimation using Monocular Sequences via Swin Transformer and Densely Cascaded Network},
  author = {Dongseok Shim and H. Jin Kim},
  journal= {arXiv preprint arXiv:2301.06715},
  year   = {2023}
}

备注

ICRA 2023