Mask3D:通过学习掩码 3D 先验预训练 2D 视觉 Transformer
计算机视觉与模式识别
2023-03-01 v1
摘要
当前计算机视觉中流行的骨干网络,如 Vision Transformers(ViT)和 ResNets,被训练为从 2D 图像感知世界。然而,为在 2D 骨干中更有效地理解 3D 结构先验,我们提出 Mask3D,利用现有大规模 RGB-D 数据通过自监督预训练将这些 3D 先验嵌入 2D 学习特征表示。不同于需要 3D 重建或多视图对应的传统 3D 对比学习范式,我们的方法简洁:我们通过掩码单个 RGB-D 帧中的 RGB 与深度块来构建预文本重建任务。我们证明 Mask3D 在将 3D 先验嵌入强大的 2D ViT 骨干方面尤其有效,可改进各类场景理解任务(如语义分割、实例分割与目标检测)的表示学习。实验表明,Mask3D 在 ScanNet、NYUv2 和 Cityscapes 图像理解任务上显著优于现有自监督 3D 预训练方法,在 ScanNet 图像语义分割上相对最先进的 Pri3D 取得 +6.5% mIoU 的提升。
引用
@article{arxiv.2302.14746,
title = {Mask3D: Pre-training 2D Vision Transformers by Learning Masked 3D Priors},
author = {Ji Hou and Xiaoliang Dai and Zijian He and Angela Dai and Matthias Nießner},
journal= {arXiv preprint arXiv:2302.14746},
year = {2023}
}
备注
accepted to CVPR2023