中文

面向局部尺度对齐单目视频深度的三维场景重建

计算机视觉与模式识别 2023-04-07 v4

摘要

现有的单目深度估计方法在多样场景中已展现出优异的鲁棒性,但它们仅能恢复仿射不变深度,即存在未知的尺度与偏移。然而,在一些基于视频的场景中,如视频深度估计与从视频进行三维场景重建,逐帧预测中存在的未知尺度与偏移可能导致深度不一致。为解决该问题,我们提出一种局部加权线性回归方法,利用极稀疏锚点恢复尺度与偏移,从而确保连续帧间的尺度一致性。大量实验表明,在多个零样本基准上,我们的方法最多可将现有最先进方法的性能提升 50%。此外,我们合并了超过 630 万张 RGBD 图像以训练强鲁棒深度模型。我们生成的 ResNet50 骨干模型甚至优于最先进的 DPT ViT-Large 模型。结合基于几何的重建方法,我们构建了一种新的稠密三维场景重建流程,其同时受益于稀疏点的尺度一致性与单目方法的鲁棒性。通过对视频执行简单的逐帧预测,即可恢复准确的三维场景形状。

关键词

引用

@article{arxiv.2202.01470,
  title  = {Towards 3D Scene Reconstruction from Locally Scale-Aligned Monocular Video Depth},
  author = {Guangkai Xu and Wei Yin and Hao Chen and Chunhua Shen and Kai Cheng and Feng Wu and Feng Zhao},
  journal= {arXiv preprint arXiv:2202.01470},
  year   = {2023}
}

备注

Technical error