中文

Depthformer:融合局部与全局信息的多尺度视觉 Transformer 单目深度估计方法

计算机视觉与模式识别 2022-07-13 v2

摘要

基于注意力的模型如 transformer 因其在图像中捕获长程依赖的能力,在语义分割等密集预测任务上展现出卓越性能。然而,transformer 对单目深度预测的益处迄今鲜有探索。本文在室内 NYUV2 数据集与室外 KITTI 数据集上基准测试了多种基于 transformer 的模型用于深度估计任务。我们提出了一种新颖的基于注意力的架构 Depthformer 用于单目深度估计,其利用多头自注意力生成多尺度特征图,并通过我们提出的解码器网络有效融合。我们还提出了 Transbins 模块,将深度范围划分为若干 bin,其中心值按每幅图像自适应估计。最终估计的深度为每个像素的 bin 中心值的线性组合。Transbins 模块在编码阶段利用 transformer 模块的全局感受野。在 NYUV2 与 KITTI 深度估计基准上的实验结果表明,我们所提方法在均方根误差(RMSE)上分别将最优性能提升了 3.3% 与 3.3%。代码见 https://github.com/ashutosh1807/Depthformer.git。

关键词

引用

@article{arxiv.2207.04535,
  title  = {Depthformer : Multiscale Vision Transformer For Monocular Depth Estimation With Local Global Information Fusion},
  author = {Ashutosh Agarwal and Chetan Arora},
  journal= {arXiv preprint arXiv:2207.04535},
  year   = {2022}
}