中文

MVSFormer++:揭示变换器细节中的魔鬼——多视图立体

计算机视觉与模式识别 2024-01-23 v1

摘要

基于学习的多视图立体(MVS)方法的最新进展显著地采用了带有注意力机制的变换器模型。然而,现有方法尚未深入探究变换器对不同MVS模块的深刻影响,导致深度估计能力有限。在本文中,我们介绍了MVSFormer++,一种谨慎地最大化注意力固有特性以增强MVS流水线各个组件的方法。形式上,我们的方法涉及将跨视图信息注入预训练的DINOv2模型以促进MVS学习。此外,我们对特征编码器和代价体正则化采用不同的注意力机制,分别关注特征聚合和空间聚合。另外,我们揭示了一些设计细节会显著影响变换器模块在MVS中的性能,包括归一化三维位置编码、自适应注意力缩放和层归一化的位置。在DTU、Tanks-and-Temples、BlendedMVS和ETH3D上的全面实验验证了所提出方法的有效性。值得注意的是,MVSFormer++在具有挑战性的DTU和Tanks-and-Temples基准上达到了最先进的性能。

关键词

引用

@article{arxiv.2401.11673,
  title  = {MVSFormer++: Revealing the Devil in Transformer's Details for Multi-View Stereo},
  author = {Chenjie Cao and Xinlin Ren and Yanwei Fu},
  journal= {arXiv preprint arXiv:2401.11673},
  year   = {2024}
}

备注

Accepted to ICLR2024