中文

SideRT:一种用于单图像深度估计的实时纯 Transformer 架构

计算机视觉与模式识别 2022-05-02 v1

摘要

由于上下文建模对于从单幅图像估计深度至关重要,研究者投入巨大努力以获取全局上下文。许多为传统基于 CNN 的架构设计的全局操作旨在克服卷积的局部性。最初为捕获长程依赖而设计的注意力机制或 transformers 可能是更好的选择,但通常使架构复杂化并可能导致推理速度下降。在本工作中,我们提出一种称为 SideRT 的纯 transformer 架构,能够实时获得优异的预测。为了更好地捕获全局上下文,设计了跨尺度注意力(CSA)和多尺度精炼(MSR)模块协同工作以高效融合不同尺度的特征。CSA 模块专注于融合高语义相似性的特征,而 MSR 模块旨在融合对应位置的特征。这两个模块包含少量无卷积的可学习参数,基于此构建了一个轻量且有效的模型。该架构在实时条件下(51.3 FPS)取得了最先进的性能,并在更小的骨干网络 Swin-T 上以合理的性能下降变得更快(83.1 FPS)。此外,其性能大幅超越先前的最先进水平,在 KITTI 上提升 AbsRel 指标 6.9%,在 NYU 上提升 9.7%。据我们所知,这是首项表明基于 transformer 的网络能在单图像深度估计领域实时取得最先进性能的工作。代码将很快公开。

关键词

引用

@article{arxiv.2204.13892,
  title  = {SideRT: A Real-time Pure Transformer Architecture for Single Image Depth Estimation},
  author = {Chang Shu and Ziming Chen and Lei Chen and Kuan Ma and Minghui Wang and Haibing Ren},
  journal= {arXiv preprint arXiv:2204.13892},
  year   = {2022}
}

备注

7 pages, 5 figures