中文

面向实时立体匹配的广义几何编码体积

计算机视觉与模式识别 2025-12-09 v1

摘要

实时立体匹配方法主要致力于提升领域内性能,但常常忽视了实际应用中泛化能力的重要性。相比之下,近期的立体基础模型利用单目基础模型(MFM)来提升泛化能力,但通常会 suffer substantial inference latency。为解决这一权衡问题,我们提出了广义几何编码体积(GGEV),这是一种实现强泛化能力的新型实时立体匹配网络。我们首先提取深度感知特征,将编码域无关结构先验作为代价聚合的指导。随后,我们引入深度感知动态代价聚合(DDCA)模块,适应性地将这些先验纳入每个视差假设,从而有效增强不可见场景中脆弱的匹配关系。上述两个步骤轻量且互补,构建出具备强泛化能力的广义几何编码体积。实验结果表明,我们的GGEV在零样本泛化能力上超越了所有现有的实时方法,并在KITTI 2012、KITTI 2015和ETH3D基准测试中实现了最先进的性能。

关键词

引用

@article{arxiv.2512.06793,
  title  = {Generalized Geometry Encoding Volume for Real-time Stereo Matching},
  author = {Jiaxin Liu and Gangwei Xu and Xianqi Wang and Chengliang Zhang and Xin Yang},
  journal= {arXiv preprint arXiv:2512.06793},
  year   = {2025}
}

备注

Accepted by AAAI 2026