基于注意力编码器-解码器网络的单图像深度单目估计
计算机视觉与模式识别
2022-10-26 v1
摘要
深度信息是感知的基础,对于自动驾驶、机器人以及其他资源受限的应用至关重要。快速获取准确且高效的深度信息能够在动态环境中实现快速响应。基于传感器的方法使用LIDAR和RADAR以高功耗、高价格和高体积为代价获得高精度。而由于深度学习的进展,基于视觉的方法近年来受到广泛关注,并能克服这些缺陷。在这项工作中,我们探索了基于视觉设置中的一个极端场景:从一张严重受网格伪影和模糊边缘困扰的单目图像中估计深度图。针对该场景,我们首先设计了一个卷积注意力机制块(CAMB),其由通道注意力和空间注意力依次组成,并将这些CAMB插入跳跃连接中。因此,我们的新方法能以最小开销找到当前图像的关注点并避免深度特征的损失。接下来,通过结合深度值、X轴、Y轴和对角线方向的梯度以及结构相似性指数度量(SSIM),我们提出了一种新颖的损失函数。此外,我们利用像素块来加速损失函数的计算。最后,通过在两个大规模图像数据集(即KITTI和NYU-V2)上的综合实验,我们表明我们的方法优于几个具有代表性的基线。
引用
@article{arxiv.2210.13646,
title = {Depth Monocular Estimation with Attention-based Encoder-Decoder Network from Single Image},
author = {Xin Zhang and Rabab Abdelfattah and Yuqi Song and Samuel A. Dauchert and Xiaofeng wang},
journal= {arXiv preprint arXiv:2210.13646},
year = {2022}
}