中文

M${^2}$Depth:自监督双帧多相机度量深度估计

计算机视觉与模式识别 2024-05-06 v1

摘要

本文提出了一种新颖的自监督双帧多相机度量深度估计网络,名为 M2{^2}Depth,旨在预测自动驾驶中可靠的尺度感知的周围深度。与以往使用单个时间步的多视图图像或单个相机的多时间步图像的工作不同,M2{^2}Depth 以来自多个相机的时间相邻的双帧图像作为输入,并生成高质量的周围深度。我们首先分别在空间域和时间域构建代价体,并提出一个时空融合模块,该模块整合时空信息以产生强大的体表示。此外,我们将来自 SAM 特征的神经先验与内部特征相结合,以减少前景和背景之间的模糊性并增强深度边缘。在 nuScenes 和 DDAD 基准上的大量实验结果表明,M2{^2}Depth 达到了最先进的性能。更多结果可在 https://heiheishuang.xyz/M2Depth 找到。

关键词

引用

@article{arxiv.2405.02004,
  title  = {M${^2}$Depth: Self-supervised Two-Frame Multi-camera Metric Depth Estimation},
  author = {Yingshuang Zou and Yikang Ding and Xi Qiu and Haoqian Wang and Haotian Zhang},
  journal= {arXiv preprint arXiv:2405.02004},
  year   = {2024}
}