中文

ChiTransformer:基于视觉线索的可靠立体匹配方法

计算机视觉与模式识别 2023-11-02 v4

摘要

当前的立体匹配技术受到受限搜索空间、遮挡区域和庞大尺寸的困扰。虽然单目深度估计不受这些挑战影响,并可通过提取的单目线索取得令人满意的结果,但缺乏立体关系使得单目预测本身可靠性较低,尤其在高度动态或杂乱环境中。为解决这两种场景下的这些问题,我们提出一种受视交叉启发自监督双目深度估计方法,其中设计了一个带有门控位置交叉注意力(GPCA)层的视觉 Transformer(ViT),以在视图间实现特征敏感的模式检索,同时保留通过自注意力聚合的广泛上下文信息。此后,单视图的单目线索由混合层利用检索到的模式对进行条件校正。这种交叉设计在生物学上类似于人类视觉系统中的视交叉结构,因此得名 ChiTransformer。我们的实验表明,该架构相比最先进的自监督立体方法提升了 11%,并可用于直线及非直线(如鱼眼)图像。项目见 https://github.com/ISL-CV/ChiTransformer。

关键词

引用

@article{arxiv.2203.04554,
  title  = {ChiTransformer:Towards Reliable Stereo from Cues},
  author = {Qing Su and Shihao Ji},
  journal= {arXiv preprint arXiv:2203.04554},
  year   = {2023}
}

备注

Published as a main conference paper at CVPR 2022