中文

面向稳健立体匹配的几何强化高效注意力调谐方案

计算机视觉与模式识别 2026-04-13 v1

摘要

尽管过去十年来图像驱动的立体匹配取得了显著进展,但合成到真实的零样本(Syn-to-Real)泛化仍是一个开放性挑战。这一次优化泛化性能主要源于图像纹理固有的跨域偏移和不明确的歧义,尤其在遮挡、纹理缺失、重复和非 Lambertian(镜面/透明)区域。为提高 Syn-to-Real 泛化,我们提出 GREATEN 框架,将表面法线作为领域不变的、对象内在的且具辨识力的几何线索来补偿图像纹理的局限性。该框架包含三个关键组件。首先,GCGF 模块自适应抑制图像特征中不可靠的上下文线索,并将过滤后的图像特征与法线驱动的几何特征融合,以构建领域不变且具辨识力的上下文-几何表示。其次,STA 策略提高了 GCGF 对非 Lambertian 区域误导视觉线索的鲁棒性。最后,稀疏注意力设计保留了 GREAT-Stereo 对遮挡和纹理相关歧义的细粒度全局特征提取能力,同时大幅降低计算开销,包括稀疏空间(SSA)、稀疏双匹配(SDMA)和简单体积(SVA)注意力。仅在合成数据如 SceneFlow 上训练的GREATEN-IGEV 在 Syn-to-Real 性能方面表现突出。具体而言,与 FoundationStereo、Monster-Stereo 和 DEFOM-Stereo 相比,GREATEN-IGEV 在 ETH3D 上降低了 30% 错误,在非 Lambertian Booster 上降低了 8.5%,在 KITTI-2015 上降低了 14.1%。此外,GREATEN-IGEV 比 GREAT-IGEV 快 19.2%,支持在 Middlebury 上进行 3K 高分辨率推断,视差范围可达 768。

关键词

引用

@article{arxiv.2604.09142,
  title  = {Geometry Reinforced Efficient Attention Tuning Equipped with Normals for Robust Stereo Matching},
  author = {Jiahao Li and Xinhong Chen and Zhengmin Jiang and Cheng Huang and Yung-Hui Li and Jianping Wang},
  journal= {arXiv preprint arXiv:2604.09142},
  year   = {2026}
}