MLG-Stereo:基于 ViT 的多阶段局部-全局增强立体匹配
计算机视觉与模式识别
2026-04-23 v1
摘要
随着深度学习的发展,基于 ViT 的立体匹配方法因其卓越的鲁棒性和零样本能力而取得了显著进展。然而,由于 ViT 在处理分辨率敏感性方面的局限性及其对局部信息的相对忽视,基于 ViT 的方法在预测细节和处理任意分辨率图像方面的能力仍弱于基于 CNN 的方法。为解决这些不足,我们提出了 MLG-Stereo,一种系统性的管线级设计,将全局建模扩展到编码器阶段之外。首先,我们提出了一种多粒度特征网络,以有效平衡全局上下文和局部几何信息,从而能够从任意分辨率的图像中提取全面特征,并弥合训练与推理尺度之间的差距。然后,构建一个局部-全局代价体,以捕获局部相关和全局感知的匹配信息。最后,引入一个局部-全局引导的循环单元,在全局信息的引导下迭代优化视差。在多个基准数据集上进行了大量实验,结果表明,与同期领先方法相比,我们的 MLG-Stereo 在 Middlebury 和 KITTI-2015 基准上表现出极具竞争力的性能,并在 KITTI-2012 数据集上取得了优异的结果。
引用
@article{arxiv.2604.20393,
title = {MLG-Stereo: ViT Based Stereo Matching with Multi-Stage Local-Global Enhancement},
author = {Haoyu Zhang and Jingyi Zhou and Peng Ye and Jiakang Yuan and Lin Zhang and Feng Xu and Tao Chen},
journal= {arXiv preprint arXiv:2604.20393},
year = {2026}
}