MonSter++:融合单目深度先验的统一立体匹配、多视图立体与实时立体方法
摘要
我们提出了 MonSter++,一个用于多视图深度估计的几何基础模型,统一了校正后的立体匹配与未校正的多视图立体匹配。这两项任务本质上都是通过对应搜索恢复度量深度,因此面临相同的困境:难以处理匹配线索有限的病态区域。为此,我们提出 MonSter++,一种将单目深度先验融入多视图深度估计的新方法,有效结合了单视图与多视图线索的互补优势。MonSter++ 将单目深度与多视图深度融合为双分支架构。基于置信度的引导自适应地选择可靠的多视图线索来校正单目深度中的尺度模糊性。经过优化的单目预测反过来又能有效引导多视图估计在病态区域中的表现。这种迭代式的相互增强使 MonSter++ 能够将粗略的物体级单目先验逐步演化为精细的像素级几何,充分释放多视图深度估计的潜力。MonSter++ 在立体匹配与多视图立体匹配任务上均达到了新的 SOTA。通过级联搜索与多尺度深度融合策略有效融合单目先验,我们的实时变体 RT-MonSter++ 也以显著优势超越了此前的实时方法。如图 1 所示,MonSter++ 在来自三个任务(立体匹配、实时立体匹配与多视图立体匹配)的八个基准上均较此前方法取得了显著提升,展现了我们框架的强大通用性。除高精度外,MonSter++ 还展现出卓越的零样本泛化能力。我们将发布大模型与实时模型,以方便开源社区使用。
引用
@article{arxiv.2501.08643,
title = {MonSter++: Unified Stereo Matching, Multi-view Stereo, and Real-time Stereo with Monodepth Priors},
author = {Junda Cheng and Wenjing Liao and Zhipeng Cai and Longliang Liu and Gangwei Xu and Xianqi Wang and Yuzhou Wang and Zikang Yuan and Yong Deng and Jinliang Zang and Yangyang Shi and Jinhui Tang and Xin Yang},
journal= {arXiv preprint arXiv:2501.08643},
year = {2025}
}
备注
MonSter++: Unified Stereo Matching, Multi-view Stereo, and Real-time Stereo with Monodepth Priors, is the extended journal version of our earlier conference paper (arXiv:2501.08643) accepted to CVPR 2025