中文

MVS2D:基于注意力驱动二维卷积的高效多视图立体

计算机视觉与模式识别 2021-12-14 v2

摘要

深度学习对多视图立体系统产生了重大影响。当前最优方法通常包含构建代价体,随后通过多次三维卷积操作来恢复输入图像的逐像素深度。尽管这种平面扫描立体的端到端学习提升了公开基准的准确性,但其计算通常非常缓慢。我们提出 \ouralg,一种高效的多视图立体算法,通过注意力机制将多视图约束无缝集成到单视图网络中。由于 \ouralg 仅基于二维卷积,其速度至少比所有知名同类方法快 2×2\times。此外,我们的算法生成精确的深度估计和三维重建,在具有挑战性的基准 ScanNet、SUN3D、RGBD 以及经典的 DTU 数据集上取得了当前最优结果。我们的算法在不精确相机位姿的设置下也优于所有其他算法。我们的代码发布于 \url{https://github.com/zhenpeiyang/MVS2D}

关键词

引用

@article{arxiv.2104.13325,
  title  = {MVS2D: Efficient Multi-view Stereo via Attention-Driven 2D Convolutions},
  author = {Zhenpei Yang and Zhile Ren and Qi Shan and Qixing Huang},
  journal= {arXiv preprint arXiv:2104.13325},
  year   = {2021}
}

备注

Our code is released at https://github.com/zhenpeiyang/MVS2D