利用大规模混合图像来源提升零样本立体匹配
计算机视觉与模式识别
2025-05-14 v1
摘要
立体匹配方法依赖稠密像素级地面实况标签,尤其对于真实世界数据集而言,获取这些标签既费时又费力。稀缺的标记数据以及合成图像与真实图像之间的领域差距也构成了显著挑战。本文提出一种新型框架 \textbf{BooSTer},其利用视觉基础模型和大规模混合图像来源,包括合成图像、真实图像和单视图图像。首先,为充分发挥大规模单视图图像的潜力,我们设计了一种数据生成策略,结合单眼深度估计和扩散模型,从单视图图像中生成稠密立体匹配数据。其次,针对真实世界数据集中的稀疏标签,我们从单眼深度估计模型迁移知识,利用伪单眼深度标签和动态尺度-平移不变损失获得额外的监督。此外,我们将视觉基础模型作为编码器,以提取稳健且可迁移的特征,提升准确率和泛化能力。广泛的实验表明,我们的方法在基准数据集上有效,尤其在标记数据有限和领域迁移场景下,显著优于现有方法。
引用
@article{arxiv.2505.08607,
title = {Boosting Zero-shot Stereo Matching using Large-scale Mixed Images Sources in the Real World},
author = {Yuran Wang and Yingping Liang and Ying Fu},
journal= {arXiv preprint arXiv:2505.08607},
year = {2025}
}