中文

MiDaS v3.1——用于鲁棒单目相对深度估计的模型库

计算机视觉与模式识别 2023-07-28 v1

摘要

我们发布用于单目深度估计的 MiDaS v3.1,提供基于不同编码器骨干的多种新模型。此发布的动机源于 transformer 在计算机视觉中的成功,目前有大量预训练视觉 transformer 可用。我们探究使用最有前景的视觉 transformer 作为图像编码器如何影响 MiDaS 架构的深度估计质量与运行时间。我们的研究也包含近期在图像分类任务中达到与视觉 transformer 可比质量的卷积方法。先前发布的 MiDaS v3.0 仅利用原始视觉 transformer ViT,而 MiDaS v3.1 提供基于 BEiT、Swin、SwinV2、Next-ViT 和 LeViT 的附加模型。这些模型提供不同的性能-运行时间权衡。最佳模型将深度估计质量提升 28%,而高效模型赋能需要高帧率的下游任务。我们也描述了集成新骨干的通用流程。总结本工作的视频见 https://youtu.be/UjaeNNFf9sE,代码见 https://github.com/isl-org/MiDaS。

关键词

引用

@article{arxiv.2307.14460,
  title  = {MiDaS v3.1 -- A Model Zoo for Robust Monocular Relative Depth Estimation},
  author = {Reiner Birkl and Diana Wofk and Matthias Müller},
  journal= {arXiv preprint arXiv:2307.14460},
  year   = {2023}
}

备注

14 pages, 2 figures