METER:一种用于单目深度估计的移动视觉Transformer架构
计算机视觉与模式识别
2024-03-14 v1
摘要
深度估计是自主系统评估自身状态和感知周围环境所需的基础知识。近年来,基于深度学习的深度估计算法因其在克服主动深度传感系统局限性方面的潜在优势而引起了广泛关注。此外,由于单目相机成本低、体积小,研究人员将注意力集中在单目深度估计(MDE)上,即从单个RGB视频帧估计稠密深度图。当前最先进的MDE模型通常依赖于深度大且复杂的视觉Transformer(ViT)架构,这使得它们不适合在具有硬件约束的设备上进行快速推理。为此,本文探讨了在嵌入式设备上利用ViT进行MDE的问题。这些系统通常具有有限的内存能力和低功耗CPU/GPU。我们提出了METER,一种新颖的轻量级视觉Transformer架构,能够在所考虑的嵌入式硬件(NVIDIA Jetson TX1和NVIDIA Jetson Nano)上实现最先进的估计性能和低延迟推理。我们提供的解决方案包括METER的三种可选配置、一种用于平衡像素估计与图像细节重建的新型损失函数,以及一种用于改善最终整体预测的新数据增强策略。在两个基准数据集(室内NYU Depth v2和室外KITTI)上,所提出的方法优于以往的轻量级工作。
引用
@article{arxiv.2403.08368,
title = {METER: a mobile vision transformer architecture for monocular depth estimation},
author = {L. Papa and P. Russo and I. Amerini},
journal= {arXiv preprint arXiv:2403.08368},
year = {2024}
}