中文

基于多基准几何一致性的无监督立体匹配

计算机视觉与模式识别 2026-01-06 v2

摘要

光度损失和伪标签驱动的自训练是用于训练无标签数据上立体网络的两种常用方法,但它们都在遮挡区域难以提供准确的监督。前者缺乏有效的对应关系,而后者的伪标签往往不可靠。为克服这些限制,我们提出了 S3^3 框架,该框架基于多基准几何一致性。与常规自训练不同,S3^3 为教师网络和学生网络分配不同的目标图像,引入了自然的可见性不对称性。在学生视角中被遮挡的区域往往在教师视角中仍可见且可匹配,从而即使在光度监督失败的区域也能提供可靠的伪标签。教师的视差被重新缩放以与学生的基准对齐,用于指导学生学习。进一步提出了一种受遮挡感知加权策略,以缓解教师遮挡区域不可靠监督的影响,并鼓励学生学习鲁棒的遮挡完成。为支持训练,我们构建了 MBS20K 数据集,该数据集是使用 CARLA 模拟器合成的多基准立体数据集。大量实验表明,S3^3 在遮挡和非遮挡区域均能提供有效监督,实现了强大的泛化性能,并在 KITTI 2015 和 2012 基准测试中超越了以往的最先进方法。

关键词

引用

@article{arxiv.2508.10838,
  title  = {Unsupervised Stereo via Multi-Baseline Geometry-Consistent Self-Training},
  author = {Peng Xu and Zhiyu Xiang and Tingming Bai and Tianyu Pu and Kai Wang and Chaojie Ji and Zhihao Yang and Eryun Liu},
  journal= {arXiv preprint arXiv:2508.10838},
  year   = {2026}
}