SM4Depth:单模型无缝跨多相机与场景的单目度量深度估计
计算机视觉与模式识别
2024-08-16 v2 人工智能
摘要
过去一年中,通用单目度量深度估计(universal MMDE)作为视频与图像编辑等多种多媒体任务的基础模型,获得了广泛关注。然而,现有方法在没有场景特定参数和预训练的情况下,难以在不同场景中保持一致的精度,阻碍了MMDE的实用性。此外,这些方法依赖包含数百万甚至数千万数据的大规模数据集进行训练,导致显著的时间和硬件开销。本文提出SMDepth,一个无需大量训练数据和GPU集群即可无缝适用于室内外场景的模型。首先,为在不同场景中获得一致的深度,我们提出了一种新颖的度量尺度建模方法,即基于变化的非归一化深度箱。它减少了传统度量箱的模糊性,并能在训练期间更好地适应场景间的大深度差距。其次,我们提出了一种“分而治之”的解决方案,以减少对海量训练数据的依赖。度量箱并非直接从庞大的解空间中估计,而是从多个解子空间进行估计,以降低复杂度。此外,我们引入了一个未裁剪的深度数据集BUPT Depth,用于评估各种室内外场景下的深度精度和一致性。SMDepth仅使用15万对RGB-D数据在消费级GPU上训练,在大多数前所未见的数据集上取得了卓越的性能,尤其是在室内外场景中保持了一致的精度。代码可在https://github.com/mRobotit/SM4Depth找到。
引用
@article{arxiv.2403.08556,
title = {SM4Depth: Seamless Monocular Metric Depth Estimation across Multiple Cameras and Scenes by One Model},
author = {Yihao Liu and Feng Xue and Anlong Ming and Mingshuai Zhao and Huadong Ma and Nicu Sebe},
journal= {arXiv preprint arXiv:2403.08556},
year = {2024}
}
备注
Accepted by ACM MultiMedia 24, Project Page: xuefeng-cvr.github.io/SM4Depth