注意力无处不在:基于跳跃注意力的单目深度预测
计算机视觉与模式识别
2022-10-18 v1
摘要
单目深度估计(MDE)旨在给定单张 RGB 图像的情况下预测逐像素深度。对于卷积模型以及近期的基于注意力的模型,基于编码器-解码器的架构因同时对全局上下文和像素级分辨率的需求而被证明是有用的。通常,使用跳跃连接模块来融合编码器和解码器特征,其包含特征图拼接后接卷积操作。受注意力在大量计算机视觉问题中已证实收益的启发,我们提出一种基于注意力的编码器与解码器特征融合方法。我们将 MDE 视为像素查询细化问题,其中使用最粗层编码器特征来初始化像素级查询,然后通过所提出的跳跃注意力模块(SAM)将其细化到更高分辨率。我们将预测问题表述为对离散化连续深度范围的箱中心的序数回归,并引入箱中心预测器(BCP)模块,该模块利用像素查询在最粗层预测箱。除了图像自适应深度分箱的好处外,所提出的设计通过来自真值的直接监督,有助于在初始像素查询中学习改进的深度嵌入。在 NYUV2 和 KITTI 两个标准数据集上的大量实验表明,我们的架构分别以 5.3% 和 3.9% 的优势优于 SOTA,并在 SUNRGBD 数据集上以 9.4% 提升了泛化性能。代码可在 https://github.com/ashutosh1807/PixelFormer.git 获取。
引用
@article{arxiv.2210.09071,
title = {Attention Attention Everywhere: Monocular Depth Prediction with Skip Attention},
author = {Ashutosh Agarwal and Chetan Arora},
journal= {arXiv preprint arXiv:2210.09071},
year = {2022}
}
备注
Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2023