中文

SMFormer:通过基础模型和数据增强赋能自监督立体匹配

计算机视觉与模式识别 2026-04-14 v1

摘要

近期的自监督立体匹配方法取得了显著进展。它们通常依赖光度一致性假设,即认为跨视图的对应点共享相同的外观。然而,这一假设可能因现实世界的干扰而受到破坏,导致无效的监督信号,与受监督方法之间存在显著的精度差距。为此,我们提出SMFormer框架,集成由视觉基础模型(Vision Foundation Model, VFM)指导的更可靠自监督与数据增强。首先,我们将VFM与特征金字塔网络(Feature Pyramid Network, FPN)集成,提供对各种场景下干扰更具辨别力和稳健性的特征表示。然后,我们构构一种有效的数据增强机制,确保对各种变换的鲁棒性。该数据增强机制明确强制学习特征与受照明变化影响的特征之间的一致性。此外,它正则化了强增强样本的视差预测输出与标准样本生成的视差预测之间的一致性。实验在多个主流基准上表明,我们的SMFormer在自监督方法中实现了最新(State-of-the-Art, SOTA)性能,甚至与受监督方法持平。值得注意的是,在具有挑战性的Booster基准上,SMFormer甚至超过了一些SOTA受监督方法,如CFNet。

关键词

引用

@article{arxiv.2604.10218,
  title  = {SMFormer: Empowering Self-supervised Stereo Matching via Foundation Models and Data Augmentation},
  author = {Yun Wang and Zhengjie Yang and Jiahao Zheng and Zhanjie Zhang and Dapeng Oliver Wu and Yulan Guo},
  journal= {arXiv preprint arXiv:2604.10218},
  year   = {2026}
}