FrozenRecon:利用冻结深度模型的无位姿三维场景重建
计算机视觉与模式识别
2023-08-11 v1
摘要
三维场景重建是一项长期存在的视觉任务。现有方法可分为基于几何的方法与基于学习的方法。前者利用多视图几何,但因依赖跨视图准确像素对应而可能面临灾难性失败。后者通过直接学习2D或3D表示来缓解这些问题。然而,若无大规模视频或3D训练数据,由于深度网络中存在数千万乃至数十亿优化参数,其难以泛化至多样真实场景。近来,利用大规模数据集训练的鲁棒单目深度估计模型已被证明具备弱3D几何先验,但因未知相机参数、仿射不变特性及帧间不一致性,它们不足以用于重建。在此,我们提出一种新颖的测试时优化方法,能够将LeReS等仿射不变深度模型的鲁棒性迁移至具挑战性的多样场景,同时保证帧间一致性,且每视频帧仅优化数十个参数。具体而言,我们的方法冻结预训练仿射不变深度模型的深度预测,通过几何一致性对齐模块优化未知尺度-偏移值予以校正,并利用所得尺度一致深度图鲁棒地获取相机位姿并实现稠密场景重建,即便在低纹理区域亦如此。实验表明,我们的方法在五个零样本测试数据集上实现了最先进的跨数据集重建。
引用
@article{arxiv.2308.05733,
title = {FrozenRecon: Pose-free 3D Scene Reconstruction with Frozen Depth Models},
author = {Guangkai Xu and Wei Yin and Hao Chen and Chunhua Shen and Kai Cheng and Feng Zhao},
journal= {arXiv preprint arXiv:2308.05733},
year = {2023}
}
备注
Accepted to ICCV 2023. Project webpage is at: https://aim-uofa.github.io/FrozenRecon/