中文

RayMVSNet++:学习基于射线的1D隐式场以实现精确多视图立体匹配

计算机视觉与模式识别 2023-07-21 v1

摘要

基于学习的多视图立体(MVS)迄今围绕代价体上的3D卷积展开。由于3D CNN的高计算与内存消耗,输出深度的分辨率常受严重限制。与多数致力于代价体自适应细化的现有工作不同,我们选择沿每条相机射线直接优化深度值,模拟激光扫描仪测距。这将MVS问题化简为基于射线的深度优化,比完整代价体优化轻量得多。具体地,我们提出RayMVSNet,其学习沿每条相机射线的1D隐式场序贯预测,以零交叉点指示场景深度。该基于transformer特征的序贯建模,本质上学习了传统多视图立体中的极线搜索。我们设计多任务学习以更好优化收敛与深度精度。我们发现沿每条射线的SDF单调性极大裨益深度估计。我们的方法在DTU与Tanks & Temples数据集上均排名超越此前所有基于学习的方法,在DTU上取得0.33mm的总体重建分数,在Tanks & Temples上取得59.48%的F-score。它能在无纹理表面物体/场景、严重遮挡及深度范围剧烈变化等挑战性场景下产出高质量深度估计与点云重建。进一步,我们提出RayMVSNet++以通过设计注意力门控单元选择该射线局部视锥内语义相关邻射线,增强每条射线的上下文特征聚合。RayMVSNet++在ScanNet数据集上取得最先进性能。特别地,其取得0.058m的AbsRel,并在无纹理区域与深度大变化两个子集上产出精确结果。

关键词

引用

@article{arxiv.2307.10233,
  title  = {RayMVSNet++: Learning Ray-based 1D Implicit Fields for Accurate Multi-View Stereo},
  author = {Yifei Shi and Junhua Xi and Dewen Hu and Zhiping Cai and Kai Xu},
  journal= {arXiv preprint arXiv:2307.10233},
  year   = {2023}
}

备注

IEEE Transactions on Pattern Analysis and Machine Intelligence. arXiv admin note: substantial text overlap with arXiv:2204.01320