MVSFormer++:揭示变换器细节中的魔鬼——多视图立体
计算机视觉与模式识别
2024-01-23 v1
摘要
基于学习的多视图立体(MVS)方法的最新进展显著地采用了带有注意力机制的变换器模型。然而,现有方法尚未深入探究变换器对不同MVS模块的深刻影响,导致深度估计能力有限。在本文中,我们介绍了MVSFormer++,一种谨慎地最大化注意力固有特性以增强MVS流水线各个组件的方法。形式上,我们的方法涉及将跨视图信息注入预训练的DINOv2模型以促进MVS学习。此外,我们对特征编码器和代价体正则化采用不同的注意力机制,分别关注特征聚合和空间聚合。另外,我们揭示了一些设计细节会显著影响变换器模块在MVS中的性能,包括归一化三维位置编码、自适应注意力缩放和层归一化的位置。在DTU、Tanks-and-Temples、BlendedMVS和ETH3D上的全面实验验证了所提出方法的有效性。值得注意的是,MVSFormer++在具有挑战性的DTU和Tanks-and-Temples基准上达到了最先进的性能。
引用
@article{arxiv.2401.11673,
title = {MVSFormer++: Revealing the Devil in Transformer's Details for Multi-View Stereo},
author = {Chenjie Cao and Xinlin Ren and Yanwei Fu},
journal= {arXiv preprint arXiv:2401.11673},
year = {2024}
}
备注
Accepted to ICLR2024