中文

基于多模态对比掩码自编码器的两阶段渐进预训练方法

计算机视觉与模式识别 2024-09-17 v2

摘要

本文提出了一种新的渐进预训练方法,用于图像理解任务,利用RGB-D数据集。该方法利用多模态对比掩码自编码器和去噪技术。我们提出的方法分为两个阶段。在第一个阶段,我们使用对比学习预训练模型以学习跨模态表示。在第二个阶段,我们进一步使用掩码自编码和去噪/噪声预测(用于扩散模型)进行预训练。掩码自编码侧重于利用局部空间相关性重建输入模态中缺失的 patches,而去噪学习输入数据的高频成分。此外,它在第二个阶段融合了全局蒸馏,利用阶段一获取的知识。我们的方法可扩展、稳健,适用于RGB-D数据集的预训练。多个数据集上的大量实验表明,我们方法的有效性和优越性能。具体而言,我们在ScanNet语义分割上相较于Mask3D提高了+1.3% mIoU。我们进一步通过在语义分割任务中对低数据情境下的效果进行评估,表明了该方法在低数据 regime 下的有效性。

关键词

引用

@article{arxiv.2408.02245,
  title  = {A Two-Stage Progressive Pre-training using Multi-Modal Contrastive Masked Autoencoders},
  author = {Muhammad Abdullah Jamal and Omid Mohareri},
  journal= {arXiv preprint arXiv:2408.02245},
  year   = {2024}
}