RayMVSNet:学习基于射线的 1D 隐式场以实现精确多视图立体匹配
计算机视觉与模式识别
2022-04-05 v1
摘要
基于学习的多视图立体匹配(MVS)迄今主要围绕代价体上的 3D 卷积展开。由于 3D CNN 的高计算与内存消耗,输出深度的分辨率往往受到显著限制。与多数致力于代价体自适应精化的现有工作不同,我们选择沿每条相机射线直接优化深度值,模拟激光扫描仪的距离(深度)探测。这将 MVS 问题简化为基于射线的深度优化,其比完整的代价体优化轻量得多。具体而言,我们提出 RayMVSNet,它学习沿每条相机射线顺序预测一维隐式场,以过零点指示场景深度。这种基于 transformer 特征进行的序列建模,本质上学习了传统多视图立体匹配中的极线搜索。我们还设计了多任务学习以获得更好的优化收敛与深度精度。我们的方法在 DTU 与 Tanks & Temples 数据集上均超越此前所有基于学习的方法,在 DTU 上取得 0.33mm 的总体重建误差,在 Tanks & Temples 上取得 59.48% 的 f-score。
引用
@article{arxiv.2204.01320,
title = {RayMVSNet: Learning Ray-based 1D Implicit Fields for Accurate Multi-View Stereo},
author = {Junhua Xi and Yifei Shi and Yijie Wang and Yulan Guo and Kai Xu},
journal= {arXiv preprint arXiv:2204.01320},
year = {2022}
}
备注
cvpr 2022, 11 pages