Prism:基于单目结构先验的半监督多视角立体视觉
计算机视觉与模式识别
2024-12-10 v1
摘要
无监督多视角立体视觉(MVS)的目标是利用大规模无标签数据集,但当前方法在困难数据(如室内场景的手持智能手机视频)上训练时表现不佳。与此同时,高质量的合成数据集已经可用,但在这些数据集上训练的MVS网络无法泛化到真实世界样本。为弥合这一差距,我们提出了一种半监督学习框架,允许我们在真实图像和渲染图像上联合训练,从合成数据中捕获结构先验,同时确保与真实世界域的一致性。我们框架的核心是一组新颖的损失函数,利用在合成数据集上训练的强大单目相对深度估计器,将丰富的相对深度结构信息迁移到无标签数据上的MVS预测。受感知图像度量的启发,我们通过深度特征损失和多尺度统计损失来比较MVS预测与单目预测。我们将完整框架命名为Prism,在定量和定性上均显著优于当前的无监督和合成监督MVS网络。这是最佳情况下的结果,为同时利用无标签智能手机视频和照片级真实感合成数据集训练MVS网络打开了大门。
引用
@article{arxiv.2412.05771,
title = {Prism: Semi-Supervised Multi-View Stereo with Monocular Structure Priors},
author = {Alex Rich and Noah Stier and Pradeep Sen and Tobias Höllerer},
journal= {arXiv preprint arXiv:2412.05771},
year = {2024}
}
备注
11 pages, 6 figures, 3 tables