中文

DepthFormer:利用长程关联与局部信息实现精确单目深度估计

计算机视觉与模式识别 2023-10-13 v1

摘要

本文旨在解决有监督单目深度估计问题。我们以一项精细的先导研究开篇,表明长程关联对于精确深度估计至关重要。因此,我们提出利用 Transformer 通过有效的注意力机制建模该全局上下文。我们还采用额外的卷积分支以保留局部信息,因为 Transformer 在建模此类内容时缺乏空间归纳偏置。然而,独立分支导致特征间缺乏连接。为弥补此缺口,我们设计了层级聚合与异构交互模块,通过逐元素交互增强 Transformer 特征,并以集合到集合的变换方式建模 Transformer 与 CNN 特征间的亲和性。由于高分辨率特征图上全局注意力带来的难以承受的内存开销,我们引入可变形方案以降低复杂度。在 KITTI、NYU 和 SUN RGB-D 数据集上的大量实验表明,我们提出的模型(称为 DepthFormer)以显著优势超越了 SOTA 单目深度估计方法。值得注意的是,它在竞争激烈的 KITTI 深度估计基准上取得了最具竞争力的结果。我们的代码与模型发布于 https://github.com/zhyever/Monocular-Depth-Estimation-Toolbox。

关键词

引用

@article{arxiv.2203.14211,
  title  = {DepthFormer: Exploiting Long-Range Correlation and Local Information for Accurate Monocular Depth Estimation},
  author = {Zhenyu Li and Zehui Chen and Xianming Liu and Junjun Jiang},
  journal= {arXiv preprint arXiv:2203.14211},
  year   = {2023}
}