中文

TransMVSNet:基于 Transformer 的全局上下文感知多视图立体网络

计算机视觉与模式识别 2021-11-30 v1

摘要

在本文中,我们基于在多视图立体(MVS)中特征匹配的探索,提出了 TransMVSNet。我们将 MVS 类比回其作为特征匹配任务的本质,因此提出了一种强大的特征匹配 Transformer(FMT),利用帧内(自)注意力和帧间(交叉)注意力来聚合图像内和图像间的长程上下文信息。为了更好地适配 FMT,我们利用自适应感受野(ARF)模块来确保特征范围的平滑过渡,并通过特征通路连接不同阶段以跨不同尺度传递变换后的特征和梯度。此外,我们应用成对特征相关性来衡量特征之间的相似度,并采用消歧焦点损失来加强监督。据我们所知,TransMVSNet 是将 Transformer 引入 MVS 任务的首次尝试。因此,我们的方法在 DTU 数据集、Tanks and Temples 基准和 BlendedMVS 数据集上取得了最先进的性能。我们的方法代码将在 https://github.com/MegviiRobot/TransMVSNet 提供。

关键词

引用

@article{arxiv.2111.14600,
  title  = {TransMVSNet: Global Context-aware Multi-view Stereo Network with Transformers},
  author = {Yikang Ding and Wentao Yuan and Qingtian Zhu and Haotian Zhang and Xiangyue Liu and Yuanjiang Wang and Xiao Liu},
  journal= {arXiv preprint arXiv:2111.14600},
  year   = {2021}
}