中文

CostFormer:用于多视图立体中代价聚合的代价Transformer

计算机视觉与模式识别 2023-05-18 v1

摘要

多视图立体(MVS)的核心在于参考像素与源像素之间的匹配过程。代价聚合在此过程中起着重要作用,而先前的方法侧重于通过 CNN 来处理它。这可能继承了 CNN 的固有局限,即由于有限的局部感受野而无法区分重复或错误的匹配。为解决该问题,我们旨在将 Transformer 引入代价聚合。然而,由于 Transformer 引起的二次增长的计算复杂度,可能会出现另一个问题,导致内存溢出和推理延迟。在本文中,我们通过一种高效的基于 Transformer 的代价聚合网络(即 CostFormer)克服了这些限制。提出残差深度感知代价 Transformer(RDACT),通过沿深度和空间维度的自注意力机制在代价体上聚合长程特征。此外,提出残差回归 Transformer(RRT)以增强空间注意力。所提方法是一种通用的插件,可用于改进基于学习的 MVS 方法。

关键词

引用

@article{arxiv.2305.10320,
  title  = {CostFormer:Cost Transformer for Cost Aggregation in Multi-view Stereo},
  author = {Weitao Chen and Hongbin Xu and Zhipeng Zhou and Yang Liu and Baigui Sun and Wenxiong Kang and Xuansong Xie},
  journal= {arXiv preprint arXiv:2305.10320},
  year   = {2023}
}

备注

Accepted by IJCAI-23