中文

用于单目全景深度补全的多模态掩码预训练

计算机视觉与模式识别 2022-07-13 v5

摘要

在本文中,我们提出了一个潜在有价值的全景深度补全(PDC)任务,因为全景 3D 相机在复杂场景中常产生带有缺失数据的 360{\\deg} 深度。其目标是从原始稀疏深度与全景 RGB 图像中恢复稠密全景深度。为处理 PDC 任务,我们训练一个以深度和图像为输入的深网络以恢复稠密全景深度。然而,由于其非凸目标函数,该网络参数面临具有挑战性的优化问题。为解决此问题,我们提出一种简单而有效的方法 M{^3}PT:多模态掩码预训练。具体而言,在预训练期间,我们通过共享随机掩码同时遮盖全景 RGB 图像与稀疏深度的块,然后在被掩码区域中重建稀疏深度。据我们所知,我们首次展示了掩码预训练在多模态视觉任务中的有效性,而非由掩码自编码器(MAE)解决的单模态任务。不同于 MAE 在微调时完全丢弃预训练的解码器部分,我们的 M3^{3}PT 在预训练与微调阶段间无架构差异,仅预测密度不同,这潜在使迁移学习更便捷有效。大量实验在三个全景数据集上验证了 M{^3}PT 的有效性。值得注意的是,在三个基准数据集上,我们相较 SOTA 基线平均将 RMSE 提升 26.2%、MRE 提升 51.7%、MAE 提升 49.7%、RMSElog 提升 37.5%。

关键词

引用

@article{arxiv.2203.09855,
  title  = {Multi-Modal Masked Pre-Training for Monocular Panoramic Depth Completion},
  author = {Zhiqiang Yan and Xiang Li and Kun Wang and Zhenyu Zhang and Jun Li and Jian Yang},
  journal= {arXiv preprint arXiv:2203.09855},
  year   = {2022}
}

备注

Accepted by ECCV2022