中文

通过注意力拼接代价体实现准确高效的立体匹配

计算机视觉与模式识别 2023-11-21 v3

摘要

立体匹配是许多视觉与机器人应用的基础构件。信息丰富且紧凑的代价体表示对于高精度与高效率的立体匹配至关重要。本文提出一种新颖的代价体构建方法,称为注意力拼接体(ACV),其从相关性线索生成注意力权重,以抑制拼接体中的冗余信息并增强与匹配相关的信息。ACV 可无缝嵌入大多数立体匹配网络,所得网络可采用更轻量的聚合网络并同时达到更高精度。我们进一步设计了 ACV 的快速版本以实现实时性能,称为 Fast-ACV,其从低分辨率相关性线索生成高似然视差假设及相应注意力权重,从而显著降低计算与内存开销,同时保持令人满意的精度。我们 Fast-ACV 的核心思想是体注意力传播(VAP),其能自动从升采样的相关性体中选取准确的相关值,并将这些准确值传播至具有模糊相关性线索的周边像素。此外,我们基于 ACV 与 Fast-ACV 分别设计了高精度网络 ACVNet 与实时网络 Fast-ACVNet,其在多个基准上取得了最先进(state-of-the-art)性能(即我们的 ACVNet 在 KITTI 2015 与 Scene Flow 上排名所有已发表方法第 2,在 KITTI 2012 与 ETH3D 上排名第 3;我们的 Fast-ACVNet 在 Scene Flow、KITTI 2012 与 2015 上几乎超越所有实时最先进方法,且具备更好的泛化能力)。

关键词

引用

@article{arxiv.2209.12699,
  title  = {Accurate and Efficient Stereo Matching via Attention Concatenation Volume},
  author = {Gangwei Xu and Yun Wang and Junda Cheng and Jinhui Tang and Xin Yang},
  journal= {arXiv preprint arXiv:2209.12699},
  year   = {2023}
}

备注

Accepted to TPAMI 2023. arXiv admin note: substantial text overlap with arXiv:2203.02146