MonoMVSNet:单目先验引导的多视图立体网络
计算机视觉与模式识别
2025-07-16 v1
摘要
基于学习的多视图立体 (MVS) 方法旨在预测序列中已校准图像的深度图,以恢复稠密点云。然而,现有 MVS 方法在诸如纹理缺失区域和反射表面等具有挑战性的区域时往往难以应对,因而特征匹配会失败。相比之下,单目深度估计无需进行特征匹配,能够在这些区域实现稳健的相对深度估计。为弥合这一差距,我们提出了 MonoMVSNet,这是一种新颖的单目特征和深度引导的 MVS 网络,将单目基础模型中的强大先验集成到多视图几何中。首先,通过新设计的跨视图位置编码和注意力机制,将参考视图的单目特征整合到源视图特征中。然后,在采样过程中,参考视图的单目深度对深度候选数进行对齐,以动态更新边缘区域的深度候选数。最后,基于单目深度进一步设计了相对一致性损失以监督深度预测。大量实验表明,MonoMVSNet 在 DTU 和 Tanks-and-Temples 数据集上实现了最先进的性能,在 Tanks-and-Temples Intermediate 和 Advanced 基准中名列第一。源代码可在 https://github.com/JianfeiJ/MonoMVSNet 查看。
引用
@article{arxiv.2507.11333,
title = {MonoMVSNet: Monocular Priors Guided Multi-View Stereo Network},
author = {Jianfei Jiang and Qiankun Liu and Haochen Yu and Hongyuan Liu and Liyong Wang and Jiansheng Chen and Huimin Ma},
journal= {arXiv preprint arXiv:2507.11333},
year = {2025}
}
备注
Accepted by ICCV 2025