中文

MVSFormer:通过学习鲁棒图像特征与基于温度的深度进行多视图立体视觉

计算机视觉与模式识别 2022-12-19 v3

摘要

特征表示学习是基于学习的多视图立体视觉(MVS)的关键要素。作为基于学习的 MVS 的通用特征提取器,普通的特征金字塔网络(FPN)在反射和无纹理区域产生不理想的特征表示,这限制了 MVS 的泛化能力。即使是与预训练卷积神经网络(CNN)结合使用的 FPN 也无法解决这些问题。另一方面,视觉 Transformer(ViT)在许多 2D 视觉任务中取得了显著成功。因此我们提出疑问:ViT 能否促进 MVS 中的特征学习?在本文中,我们提出了一种预训练 ViT 增强的 MVS 网络,称为 MVSFormer,它能够借助来自 ViT 的丰富先验信息学习更可靠的特征表示。通过具有高效注意力机制的分层 ViT 进行微调的 MVSFormer,可以在 FPN 的基础上取得显著改进。此外,还进一步提出了使用冻结 ViT 权重的替代 MVSFormer。这在很大程度上缓解了训练成本,同时通过自蒸馏预训练的注意力图增强了其具有竞争力的性能。通过梯度累积增强的高效多尺度训练,MVSFormer 可以泛化到各种输入分辨率。此外,我们讨论了基于分类和回归的 MVS 方法的优缺点,并进一步提出用基于温度的策略将它们统一起来。MVSFormer 在 DTU 数据集上取得了最先进的性能。特别是,MVSFormer 在竞争激烈的 Tanks-and-Temples 排行榜的中间和高级集上均排名第一。

关键词

引用

@article{arxiv.2208.02541,
  title  = {MVSFormer: Multi-View Stereo by Learning Robust Image Features and Temperature-based Depth},
  author = {Chenjie Cao and Xinlin Ren and Yanwei Fu},
  journal= {arXiv preprint arXiv:2208.02541},
  year   = {2022}
}