中文

Stereo Anything: 统一零样本立体匹配的大规模混合数据方法

计算机视觉与模式识别 2025-09-18 v3

摘要

立体匹配是 3D 视觉中的核心任务,旨在建立立体图像对之间的像素级对应关系以实现深度恢复。尽管深度神经网络架构推动了显著进展,但当前模型在部署于未见域时常出现严重性能下降,主要由于训练数据多样性有限。本文引入 StereoAnything,一个数据导向的框架,大幅提升现有立体模型的零样本泛化能力。我们并非设计新的专用架构,而是将立体训练规模提升至前所未有的水平,通过系统性地统一异构立体数据源:(1) 涵盖多样环境的精选标注数据集,(2) 从无标签单目图像生成的大规模合成立体对。我们的混合数据策略在跨域之间提供一致且稳健的学习信号,有效缓解数据集偏差。对四个公开基准的广泛零样本评估表明,Stereo Anything 实现了零样本泛化的领先性能。这一工作为实现真正通用的立体匹配指明了道路,提供了适用于任何立体图像对的可扩展数据范式。我们在四个公开数据集上广泛评估了该模型的零样本能力,展示了其对任何立体图像对的惊人泛化能力。代码已公开于 https://github.com/XiandaGuo/OpenStereo。

关键词

引用

@article{arxiv.2411.14053,
  title  = {Stereo Anything: Unifying Zero-shot Stereo Matching with Large-Scale Mixed Data},
  author = {Xianda Guo and Chenming Zhang and Youmin Zhang and Ruilin Wang and Dujun Nie and Wenzhao Zheng and Matteo Poggi and Hao Zhao and Mang Ye and Qin Zou and Long Chen},
  journal= {arXiv preprint arXiv:2411.14053},
  year   = {2025}
}

备注

Code will be available at \url{https://github.com/XiandaGuo/OpenStereo}