MVSAnywhere:零样本多视图立体
计算机视觉与模式识别
2025-03-31 v1
摘要
从多个视角计算准确深度是计算机视觉中的一个基本且长期存在的挑战。然而,大多数现有方法在不同领域和场景类型(例如室内 vs. 户外)之间难以很好地泛化。训练一个通用多视图立体模型具有挑战性,并引发若干问题,例如:如何最好地利用基于转换器的架构、如何在输入视角数目可变时纳入额外元数据,以及如何估计不同场景下有效深度范围——这些范围通常事先未知?为此,我们引入了MVSA,这是一个新型且通用的多视图立体架构,旨在通过在不同领域和深度范围内实现泛化,随处可用。MVSA结合了单目和多目线索,并采用自适应成本体积以处理与尺度相关的问题。我们在Robust Multi-View Depth基准测试上实现了领先的零样本深度估计,超越了现有的多视图立体和单目基线方法。
引用
@article{arxiv.2503.22430,
title = {MVSAnywhere: Zero-Shot Multi-View Stereo},
author = {Sergio Izquierdo and Mohamed Sayed and Michael Firman and Guillermo Garcia-Hernando and Daniyar Turmukhambetov and Javier Civera and Oisin Mac Aodha and Gabriel Brostow and Jamie Watson},
journal= {arXiv preprint arXiv:2503.22430},
year = {2025}
}
备注
CVPR 2025