中文

改进Transformer中的深度梯度连续性:基于CNN的单目深度估计对比研究

计算机视觉与模式识别 2024-07-25 v4

摘要

单目深度估计是计算机视觉中一项持续的挑战。近期Transformer模型的进展已表明其在该领域相较传统CNN具有显著优势。然而,在理解这些模型如何优先关注二维图像中的不同区域以及这些区域如何影响深度估计性能方面,仍存在空白。为探究Transformer与CNN之间的差异,我们采用稀疏像素方法对二者进行对比分析。我们的发现表明,尽管Transformer在处理全局上下文与复杂纹理方面表现出色,但在保持深度梯度连续性上落后于CNN。为进一步提升Transformer模型在单目深度估计中的性能,我们提出深度梯度细化(Depth Gradient Refinement, DGR)模块,通过高阶微分、特征融合与重标定来细化深度估计。此外,我们利用最优传输理论,将深度图视为空间概率分布,并采用最优传输距离作为损失函数优化模型。实验结果表明,集成即插即用的深度梯度细化(DGR)模块与所提损失函数的模型,在室外KITTI与室内NYU-Depth-v2数据集上均在不增加复杂度与计算成本的前提下提升了性能。本研究不仅为Transformer与CNN在深度估计中的差异提供了新见解,也为新颖的深度估计方法铺平了道路。

关键词

引用

@article{arxiv.2308.08333,
  title  = {Improving Depth Gradient Continuity in Transformers: A Comparative Study on Monocular Depth Estimation with CNN},
  author = {Jiawei Yao and Tong Wu and Xiaofeng Zhang},
  journal= {arXiv preprint arXiv:2308.08333},
  year   = {2024}
}

备注

Accepted by BMVC 2024. Project page: https://github.com/Jiawei-Yao0812/PixelFormer_DGR