面向局部尺度对齐单目视频深度的三维场景重建
计算机视觉与模式识别
2023-04-07 v4
摘要
现有的单目深度估计方法在多样场景中已展现出优异的鲁棒性,但它们仅能恢复仿射不变深度,即存在未知的尺度与偏移。然而,在一些基于视频的场景中,如视频深度估计与从视频进行三维场景重建,逐帧预测中存在的未知尺度与偏移可能导致深度不一致。为解决该问题,我们提出一种局部加权线性回归方法,利用极稀疏锚点恢复尺度与偏移,从而确保连续帧间的尺度一致性。大量实验表明,在多个零样本基准上,我们的方法最多可将现有最先进方法的性能提升 50%。此外,我们合并了超过 630 万张 RGBD 图像以训练强鲁棒深度模型。我们生成的 ResNet50 骨干模型甚至优于最先进的 DPT ViT-Large 模型。结合基于几何的重建方法,我们构建了一种新的稠密三维场景重建流程,其同时受益于稀疏点的尺度一致性与单目方法的鲁棒性。通过对视频执行简单的逐帧预测,即可恢复准确的三维场景形状。
引用
@article{arxiv.2202.01470,
title = {Towards 3D Scene Reconstruction from Locally Scale-Aligned Monocular Video Depth},
author = {Guangkai Xu and Wei Yin and Hao Chen and Chunhua Shen and Kai Cheng and Feng Wu and Feng Zhao},
journal= {arXiv preprint arXiv:2202.01470},
year = {2023}
}
备注
Technical error