CroCo:通过跨视角补全实现三维视觉任务的自监督预训练
计算机视觉与模式识别
2023-01-16 v2
摘要
掩码图像建模(MIM)近来已被确立为一种强有力的预训练范式。其 pretext task 通过对输入图像中的图像块进行掩码来构造,然后由神经网络仅以可见图像块为输入来预测被掩码的内容。当针对高层语义任务(如图像分类和目标检测)进行微调时,这种预训练可取得最先进的性能。在本文中,我们转而寻求学习能够很好地迁移到各种三维视觉及低层几何下游任务(如深度预测或光流估计)的表征。受 MIM 启发,我们提出了一种从无监督表征学习任务,该任务由展示同一场景不同视角的图像对训练得到。更确切地说,我们提出跨视角补全这一 pretext task:第一张输入图像被部分掩码,必须从可见内容和第二张图像重建被掩码的内容。在单视角 MIM 中,被掩码内容往往无法仅从可见部分精确推断,因此模型学习充当受高层语义影响的先验。相反,若模型能够理解两幅图像间的空间关系,则该歧义可通过第二张未掩码图像的跨视角补全来消除。我们的实验表明,我们的 pretext task 显著提升了单目三维视觉下游任务(如深度估计)的性能。此外,我们的模型可直接应用于双目下游任务(如光流或相对相机位姿估计),无需任何花哨设计即可取得有竞争力的结果,即采用通用架构而不作任何任务特定设计。
引用
@article{arxiv.2210.10716,
title = {CroCo: Self-Supervised Pre-training for 3D Vision Tasks by Cross-View Completion},
author = {Philippe Weinzaepfel and Vincent Leroy and Thomas Lucas and Romain Brégier and Yohann Cabon and Vaibhav Arora and Leonid Antsfeld and Boris Chidlovskii and Gabriela Csurka and Jérôme Revaud},
journal= {arXiv preprint arXiv:2210.10716},
year = {2023}
}
备注
NeurIPS 2022