中文

基于Transformer的多视立体视觉

计算机视觉与模式识别 2021-12-02 v1

摘要

本文提出一种称为MVSTR的网络,用于多视立体视觉(MVS)。该网络基于Transformer构建,能够提取具有全局上下文和3D一致性的稠密特征,这对实现MVS的可靠匹配至关重要。具体而言,为解决现有基于CNN的MVS方法感受野有限的问题,首先提出全局上下文Transformer模块以探索视图内全局上下文。此外,为进一步使稠密特征具备3D一致性,构建了3D几何Transformer模块,其带有精心设计的跨视图注意力机制以促进视图间信息交互。实验结果表明,所提出的MVSTR在DTU数据集上取得了最佳综合性能,并在Tanks & Temples基准数据集上表现出强泛化能力。

关键词

引用

@article{arxiv.2112.00336,
  title  = {Multi-View Stereo with Transformer},
  author = {Jie Zhu and Bo Peng and Wanqing Li and Haifeng Shen and Zhe Zhang and Jianjun Lei},
  journal= {arXiv preprint arXiv:2112.00336},
  year   = {2021}
}