Metric3D:面向单图像零样本度量 3D 预测
计算机视觉与模式识别
2023-07-21 v1 人工智能
摘要
从图像重建精确 3D 场景是一项长期存在的视觉任务。由于单图像重建问题的不适定性,大多数成熟方法建立在多视图几何之上。最先进的(SOTA)单目度量深度估计方法仅能处理单一相机模型,且因度量模糊性而无法进行混合数据训练。同时,在大型混合数据集上训练的 SOTA 单目方法通过学习仿射不变深度实现零样本泛化,但无法恢复真实世界度量。本工作中,我们表明零样本单视图度量深度模型的关键在于大规模数据训练与解决来自不同相机模型的度量模糊性的结合。我们提出一个规范相机空间变换模块,其显式解决模糊性问题并可轻松插入现有单目模型。配备我们的模块后,单目模型可利用超八百万张图像与数千种相机模型稳定训练,从而对具有未见相机设置的野外部图像实现零样本泛化。实验在 7 个零样本基准上展示了我们方法的 SOTA 性能。值得注意的是,我们的方法在第二届单目深度估计挑战赛中夺得冠军。我们的方法能够在随机收集的互联网图像上准确恢复度量 3D 结构,为合理的单图像计量铺平道路。潜在收益延伸至下游任务,仅需插入我们的模型即可显著改进。例如,我们的模型缓解了单目-SLAM 的尺度漂移问题(图 1),从而实现高质量度量尺度稠密建图。代码见 https://github.com/YvanYin/Metric3D。
引用
@article{arxiv.2307.10984,
title = {Metric3D: Towards Zero-shot Metric 3D Prediction from A Single Image},
author = {Wei Yin and Chi Zhang and Hao Chen and Zhipeng Cai and Gang Yu and Kaixuan Wang and Xiaozhi Chen and Chunhua Shen},
journal= {arXiv preprint arXiv:2307.10984},
year = {2023}
}
备注
Accepted to ICCV 2023. Won the championship in the 2nd Monocular Depth Estimation Challenge. The code is available at https://github.com/YvanYin/Metric3D