中文

基于注意力感知代价体金字塔的多视图立体网络用于三维重建

计算机视觉与模式识别 2020-12-01 v1 机器学习 图像与视频处理

摘要

我们提出了一种高效的多视图立体(MVS)网络,用于从多视图图像进行三维重建。尽管先前基于学习的重建方法表现相当好,但它们大多使用固定深度假设的平面扫描体在固定分辨率下估计深度图,这需要密集采样的平面以达到所需精度,因此难以获得高分辨率深度图。本文引入一种由粗到细的深度推断策略以实现高分辨率深度。该策略在最粗层级估计深度图,而较细层级的深度图被视为上一层上采样深度图加上像素级深度残差。因此,我们利用上一层的先验信息缩小深度搜索范围,并从像素级深度残差构建新的代价体以进行深度图细化。由于所有层级间参数共享,最终深度图可通过迭代获得。在每一层,我们将自注意力层引入特征提取块以捕获深度推断任务的远程依赖,并且使用相似性度量而非先前工作基于方差的方法生成代价体。实验在 DTU 基准数据集和近期发布的 BlendedMVS 数据集上进行。结果表明我们的模型优于大多数当前最优(SOTA)方法。本项目代码库位于 https://github.com/ArthasMil/AACVP-MVSNet。

关键词

引用

@article{arxiv.2011.12722,
  title  = {Attention Aware Cost Volume Pyramid Based Multi-view Stereo Network for 3D Reconstruction},
  author = {Anzhu Yu and Wenyue Guo and Bing Liu and Xin Chen and Xin Wang and Xuefeng Cao and Bingchuan Jiang},
  journal= {arXiv preprint arXiv:2011.12722},
  year   = {2020}
}