中文

CT-MVSNet:基于跨尺度 Transformer 的高效多视图立体匹配

计算机视觉与模式识别 2024-02-05 v2

摘要

近期的深度多视图立体匹配(MVS)方法已广泛将 Transformer 结合到级联网络中用于高分辨率深度估计,并取得了令人瞩目的成果。然而,现有的基于 Transformer 的方法受限于其计算成本,阻碍了其向更精细阶段的扩展。在本文中,我们提出了一种新颖的跨尺度 Transformer(CT),能够在不增加额外计算的情况下处理不同阶段的特征表示。具体而言,我们引入了自适应匹配感知 Transformer(AMT),在多个尺度上采用不同的交互注意力组合。这种组合策略使我们的网络能够捕获图像内上下文信息并增强图像间特征关系。此外,我们提出了双特征引导聚合(DFGA),将粗略的全局语义信息嵌入到更精细的代价卷构建中,以进一步增强全局和局部特征感知。同时,我们设计了特征度量损失(FM Loss),通过评估变换前后的特征偏差来减少特征不匹配对深度估计的影响。在 DTU 数据集和 Tanks and Temples (T&T) 基准上的大量实验表明,我们的方法取得了 SOTA 结果。代码可在 https://github.com/wscstrive/CT-MVSNet 获取。

关键词

引用

@article{arxiv.2312.08594,
  title  = {CT-MVSNet: Efficient Multi-View Stereo with Cross-scale Transformer},
  author = {Sicheng Wang and Hao Jiang and Lei Xiang},
  journal= {arXiv preprint arXiv:2312.08594},
  year   = {2024}
}

备注

Accepted at the 30th International Conference on Multimedia Modeling(MMM'24 Oral)