FoundationStereo:零样本立体匹配
计算机视觉与模式识别
2025-04-07 v4 机器学习
机器人学
摘要
在通过 per-domain fine-tuning 在基准数据集上取得巨大进步的深度立体匹配领域,实现强大的零样本泛化——这是 foundation models 在其他计算机视觉任务中表现出的标志性特征——仍然具有挑战性。我们引入 FoundationStereo,一个为实现强大的零样本泛化而设计的立体深度估计 foundation model。为此,我们首先构建了一个大规模(100 万对)合成训练数据集,具有大范围多样性和高光照逼真度,随后设计了一个自动自我修整流程以去除含糊样本。我们 then 设计了若干网络架构组件来增强可扩展性,包括一种侧调校特征主干网络,它整合来自 vision foundation models 的丰富单目先验,以弥合 sim-to-real 差距,以及用于有效成本体积过滤的长程上下文推理。这些组件共同导致模型在跨域环境中表现出强大的鲁棒性和准确性,树立了零样本立体深度估计的新标准。项目页面: https://nvlabs.github.io/FoundationStereo/
引用
@article{arxiv.2501.09898,
title = {FoundationStereo: Zero-Shot Stereo Matching},
author = {Bowen Wen and Matthew Trepte and Joseph Aribido and Jan Kautz and Orazio Gallo and Stan Birchfield},
journal= {arXiv preprint arXiv:2501.09898},
year = {2025}
}
备注
CVPR 2025