中文

用于广义立体匹配的多尺度交替注意力Transformer

计算机视觉与模式识别 2023-08-08 v1

摘要

近期的立体匹配网络通过引入对极线约束来限制双视图的匹配范围,取得了显著的性能。然而,在复杂的真实世界场景中,仅基于对极线内部的特征信息过于薄弱,不足以促进立体匹配。本文提出一种简单但高效的网络,称为交替注意力U形Transformer(AAUformer),分别平衡双视图与单视图中对极线的影响,以获得优异的泛化性能。与其他模型相比,我们的模型有几个主要设计:1)为了更好地在像素级解放单视图的局部语义特征,我们引入窗口自注意力以打破行内自注意力的限制,并在交叉匹配前完全替代卷积网络以提取更稠密的特征;2)设计了多尺度交替注意力骨干网络来提取不变特征,从而实现对难以区分区域的由粗到细匹配过程。我们在多个主流立体匹配数据集上进行了一系列对比实验和消融实验。结果表明,我们的模型在Scene Flow数据集上达到了最先进水平(SOTA),在KITTI 2015数据集上的微调性能也具有竞争力。此外,在合成与真实世界数据集的跨域泛化实验中,我们的模型优于若干最先进的工作。

关键词

引用

@article{arxiv.2308.03048,
  title  = {Multi-scale Alternated Attention Transformer for Generalized Stereo Matching},
  author = {Wei Miao and Hong Zhao and Tongjia Chen and Wei Huang and Changyan Xiao},
  journal= {arXiv preprint arXiv:2308.03048},
  year   = {2023}
}