中文

用于鲁棒立体匹配的全局遮挡感知 Transformer

计算机视觉与模式识别 2024-02-29 v1

摘要

尽管基于学习的立体匹配算法取得了显著进展,但在诸如遮挡区域等病态区域中的性能仍是瓶颈。受限于感受野,现有基于 CNN 的方法难以有效处理这些病态区域。为解决这一问题,本文提出一种新颖的基于注意力的立体匹配网络,称为全局遮挡感知 Transformer(GOAT),以利用长程依赖与遮挡感知的全局上下文进行视差估计。在 GOAT 架构中,我们提出并行的视差与遮挡估计模块 PDO,通过并行注意力机制估计初始视差图与遮挡掩膜。为进一步增强遮挡区域中的视差估计,我们提出遮挡感知全局聚合模块(OGA)。该模块旨在通过利用遮挡区域聚焦范围内的受限全局相关性来细化遮挡区域中的视差。我们在 SceneFlow、KITTI 2015 和 Middlebury 等多个公开基准数据集上进行了大量实验。结果表明,所提出的 GOAT 在所有基准上均表现出色,特别是在遮挡区域中。

关键词

引用

@article{arxiv.2312.14650,
  title  = {Global Occlusion-Aware Transformer for Robust Stereo Matching},
  author = {Zihua Liu and Yizhou Li and Masatoshi Okutomi},
  journal= {arXiv preprint arXiv:2312.14650},
  year   = {2024}
}