中文

GlocalFuse-Depth:融合Transformer与CNN的全天候自监督单目深度估计

计算机视觉与模式识别 2023-02-21 v1

摘要

近年来,自监督单目深度估计因摆脱深度标注依赖并在标准基准上取得显著成果而备受关注。然而,现有多数方法仅关注白天或夜间图像之一,由于昼夜图像间存在较大的域偏移,其在另一域上的性能会下降。为解决该问题,本文提出一种名为GlocalFuse-Depth的双分支网络,用于全天候图像的自监督深度估计。输入图像对中的白天与夜间图像分别送入两个分支:CNN分支与Transformer分支,从而可高效捕获细粒度细节与全局依赖。此外,提出一种新颖的融合模块以融合两分支的多维特征。大量实验表明,GlocalFuse-Depth在Oxford RobotCar数据集上针对全天候图像取得了最先进结果,证明了方法的优越性。

关键词

引用

@article{arxiv.2302.09884,
  title  = {GlocalFuse-Depth: Fusing Transformers and CNNs for All-day Self-supervised Monocular Depth Estimation},
  author = {Zezheng Zhang and Ryan K. Y. Chan and Kenneth K. Y. Wong},
  journal= {arXiv preprint arXiv:2302.09884},
  year   = {2023}
}