在缺乏真实世界标签的情况下通过深度基础模型提升多视图立体声重建
计算机视觉与模式识别
2025-04-17 v1
摘要
学习式多视图立体声(MVS)方法在最近几年取得了显著进展。然而,如何有效地在不使用真实世界标签的情况下训练网络仍是一个具有挑战性的问题。本文致力于最新的视觉基础模型,提出一种新方法,称为DFM-MVS,该方法利用深度基础模型生成有效深度先验,以提升缺乏真实世界标签时的MVS。具体而言,开发了一种基于深度先验的伪监督训练机制,用于生成使用生成深度先验的模拟真实立体对应关系,从而为MVS网络构建有效的监督。此外,提出了一种深度先验引导的误差校正策略,用于利用深度先验作为指导来缓解广泛使用的粗到细网络结构中固有的误差传播问题。在DTU和Tanks & Temples数据集上的实验结果表明,所提出的DFM-MVS在不使用真实世界标签的情况下显著优于现有的MVS方法。
引用
@article{arxiv.2504.11845,
title = {Boosting Multi-View Stereo with Depth Foundation Model in the Absence of Real-World Labels},
author = {Jie Zhu and Bo Peng and Zhe Zhang and Bingzheng Liu and Jianjun Lei},
journal= {arXiv preprint arXiv:2504.11845},
year = {2025}
}