中文

DwinFormer:用于端到端单目深度估计的双窗口 Transformer

计算机视觉与模式识别 2023-09-19 v2

摘要

从单幅图像估计深度在计算机视觉领域至关重要,有着大量应用。传统方法因局部感受野限制实用性,在一致性与细粒度细节间存在权衡。这种长距离依赖的缺失固有地源于架构中的卷积神经网络部分。本文提出一种基于双窗口 Transformer 的网络,即 DwinFormer,利用局部与全局特征进行端到端单目深度估计。DwinFormer 由双窗口自注意力与交叉注意力 Transformer 组成,分别为 Dwin-SAT 与 Dwin-CAT。Dwin-SAT 无缝提取复杂的局部感知特征,同时捕获全局上下文。它利用局部与全局窗口注意力巧妙捕获短程与长程依赖,无需如注意力掩码或窗口平移等复杂且计算昂贵的操作。此外,Dwin-SAT 引入归纳偏置,提供平移等变及较少依赖大规模数据等理想特性。再者,传统解码方法常依赖跳跃连接,在融合编码器与解码器特征时可能导致语义差异与全局上下文缺失。相反,Dwin-CAT 采用局部与全局窗口交叉注意力,以细粒度局部与上下文感知全局信息无缝融合编码器与解码器特征,有效修正语义鸿沟。在 NYU-Depth-V2 与 KITTI 数据集上的大量实验经验证据表明,所提方法具有优越性,在室内外环境中持续超越现有方法。

关键词

引用

@article{arxiv.2303.02968,
  title  = {DwinFormer: Dual Window Transformers for End-to-End Monocular Depth Estimation},
  author = {Md Awsafur Rahman and Shaikh Anowarul Fattah},
  journal= {arXiv preprint arXiv:2303.02968},
  year   = {2023}
}