中文

WT-MVSNet:基于窗口Transformer的多视立体视觉网络

计算机视觉与模式识别 2022-05-31 v1

摘要

近来,Transformer 被证明可通过实现长距离特征交互来提升多视立体(MVS)性能。本文中,我们提出用于多视立体中局部特征匹配与全局特征聚合的基于窗口的 Transformer(WT)。我们引入一种基于窗口的对极 Transformer(WET),其利用对极约束减少匹配冗余。由于点到直线匹配对错误的相机位姿与标定敏感,我们在对极线附近匹配窗口。采用第二个偏移 WT(Shifted WT)在代价体内聚合全局信息。我们提出一种新颖的代价 Transformer(CT)以替代 3D 卷积进行代价体正则化。为了更好地约束多视得到的深度图,我们进一步设计了一种新颖的几何一致性损失(Geo Loss),其对不满足多视一致性的不可靠区域进行惩罚。我们的 WT 多视立体方法(WT-MVSNet)在多个数据集上取得最先进性能,并在 Tanks and Temples 基准上排名 1st1^{st}

关键词

引用

@article{arxiv.2205.14319,
  title  = {WT-MVSNet: Window-based Transformers for Multi-view Stereo},
  author = {Jinli Liao and Yikang Ding and Yoli Shavit and Dihe Huang and Shihao Ren and Jia Guo and Wensen Feng and Kai Zhang},
  journal= {arXiv preprint arXiv:2205.14319},
  year   = {2022}
}