中文

SM4Depth:单模型无缝跨多相机与场景的单目度量深度估计

计算机视觉与模式识别 2024-08-16 v2 人工智能

摘要

过去一年中,通用单目度量深度估计(universal MMDE)作为视频与图像编辑等多种多媒体任务的基础模型,获得了广泛关注。然而,现有方法在没有场景特定参数和预训练的情况下,难以在不同场景中保持一致的精度,阻碍了MMDE的实用性。此外,这些方法依赖包含数百万甚至数千万数据的大规模数据集进行训练,导致显著的时间和硬件开销。本文提出SM4^4Depth,一个无需大量训练数据和GPU集群即可无缝适用于室内外场景的模型。首先,为在不同场景中获得一致的深度,我们提出了一种新颖的度量尺度建模方法,即基于变化的非归一化深度箱。它减少了传统度量箱的模糊性,并能在训练期间更好地适应场景间的大深度差距。其次,我们提出了一种“分而治之”的解决方案,以减少对海量训练数据的依赖。度量箱并非直接从庞大的解空间中估计,而是从多个解子空间进行估计,以降低复杂度。此外,我们引入了一个未裁剪的深度数据集BUPT Depth,用于评估各种室内外场景下的深度精度和一致性。SM4^4Depth仅使用15万对RGB-D数据在消费级GPU上训练,在大多数前所未见的数据集上取得了卓越的性能,尤其是在室内外场景中保持了一致的精度。代码可在https://github.com/mRobotit/SM4Depth找到。

关键词

引用

@article{arxiv.2403.08556,
  title  = {SM4Depth: Seamless Monocular Metric Depth Estimation across Multiple Cameras and Scenes by One Model},
  author = {Yihao Liu and Feng Xue and Anlong Ming and Mingshuai Zhao and Huadong Ma and Nicu Sebe},
  journal= {arXiv preprint arXiv:2403.08556},
  year   = {2024}
}

备注

Accepted by ACM MultiMedia 24, Project Page: xuefeng-cvr.github.io/SM4Depth