中文

一种用于开放航拍数据集大规模多视立体重建的新型循环编解码器结构

计算机视觉与模式识别 2020-03-17 v3

摘要

近期大量研究表明,多视立体(MVS)匹配可通过深度学习方法解决。然而,这些工作聚焦于近距物体,且由于缺少多视航拍图像基准,仅有极少数基于深度学习的方法专为大规模 3D 城市重建设计。本文中,我们提出一个为 MVS 任务创建的名为 WHU 数据集的合成航拍数据集,据我们所知,这是首个大规模多视航拍数据集。它由一个由数千张具有精确相机参数的真实航拍图像生成的高精度 3D 数字表面模型产生。我们还在此文中引入一个名为 RED-Net 的新型网络用于广域深度推断,其基于循环编解码器结构以正则化跨深度的代价图,并以 2D 全卷积网络为框架开发。RED-Net 的低内存需求与高性能使其适用于大规模且高精度的 3D 地表重建。我们的实验证实,我们的方法不仅以更少内存与计算成本在平均绝对误差(MAE)上超越当前最先进 MVS 方法 50% 以上,且效率亦更优。它胜过了基于传统方法的最佳商业软件之一,将其效率提升 16 倍。此外,我们证明在合成 WHU 数据集上预训练的 RED-Net 模型可在无任何微调的情况下高效迁移至差异很大的多视航拍图像数据集。数据集见 http://gpcv.whu.edu.cn/data。

关键词

引用

@article{arxiv.2003.00637,
  title  = {A Novel Recurrent Encoder-Decoder Structure for Large-Scale Multi-view Stereo Reconstruction from An Open Aerial Dataset},
  author = {Jin Liu and Shunping Ji},
  journal= {arXiv preprint arXiv:2003.00637},
  year   = {2020}
}