中文

MVSTER:用于高效多视图立体的对极Transformer

计算机视觉与模式识别 2022-04-18 v1

摘要

基于学习的多视图立体(MVS)方法将源图像变形到参考相机视锥体中以形成三维体,并将其融合为代价体,由后续网络进行正则化。融合步骤在连接二维语义与三维空间关联方面起着至关重要的作用。然而,先前的方法利用额外的网络学习二维信息作为融合线索,未能充分利用三维空间相关性并带来了额外的计算成本。因此,我们提出 MVSTER,其利用所提出的对极 Transformer 高效地学习二维语义与三维空间关联。具体而言,对极 Transformer 利用可分离的单目深度估计器增强二维语义,并使用交叉注意力沿对极线构建数据依赖的三维关联。此外,MVSTER 采用级联结构构建,其中利用熵正则化最优传输在每一阶段传播更精细的深度估计。大量实验表明,MVSTER 以显著更高的效率实现了最先进的重建性能:与 MVSNet 和 CasMVSNet 相比,我们的 MVSTER 在 DTU 基准上取得了 34% 和 14% 的相对提升,运行时间相对减少了 80% 和 51%。MVSTER 在所有已发表的工作中也在 Tanks&Temples-Advanced 上排名第一。代码发布于 https://github.com/JeffWang987。

关键词

引用

@article{arxiv.2204.07346,
  title  = {MVSTER: Epipolar Transformer for Efficient Multi-View Stereo},
  author = {Xiaofeng Wang and Zheng Zhu and Fangbo Qin and Yun Ye and Guan Huang and Xu Chi and Yijia He and Xingang Wang},
  journal= {arXiv preprint arXiv:2204.07346},
  year   = {2022}
}

备注

Code: https://github.com/JeffWang987/MVSTER