从单目图像精确重建三维场景形状
计算机视觉与模式识别
2022-09-07 v2
摘要
尽管过去几年取得了显著进展,使用单张单目图像进行深度估计仍面临挑战。首先,由于训练数据有限,训练一个能很好泛化到多样场景的度量深度预测模型并非易事。因此,研究者构建了更易收集的大规模相对深度数据集。然而,现有的相对深度估计模型常因使用相对深度数据训练所引起的未知深度偏移而未能恢复准确的三维场景形状。我们在此解决该问题,并尝试通过大规模相对深度数据训练并估计深度偏移来估计准确的场景形状。为此,我们提出一个两阶段框架:首先从单张单目图像预测带未知尺度与偏移的深度,然后利用三维点云数据预测深度偏移与相机焦距,从而恢复三维场景形状。由于两个模块分别训练,我们不需要严格配对的训练数据。此外,我们提出一种图像级归一化回归损失和一种基于法向的几何损失,以改进使用相对深度标注的训练。我们在九个未见数据集上测试了我们的深度模型,并在零样本评估中取得了最先进的性能。代码见:https://git.io/Depth
引用
@article{arxiv.2208.13241,
title = {Towards Accurate Reconstruction of 3D Scene Shape from A Single Monocular Image},
author = {Wei Yin and Jianming Zhang and Oliver Wang and Simon Niklaus and Simon Chen and Yifan Liu and Chunhua Shen},
journal= {arXiv preprint arXiv:2208.13241},
year = {2022}
}
备注
20 pages. Journal version of the conference paper "Learning to Recover 3D Scene Shape from a Single Image". arXiv admin note: substantial text overlap with arXiv:2012.09365