CoMAE:在小规模 RGB-D 数据集上的单模型混合预训练
计算机视觉与模式识别
2023-02-14 v1
摘要
当前的 RGB-D 场景识别方法通常为 RGB 和深度模态训练两个独立的骨干网络,并使用相同的 Places 或 ImageNet 预训练。然而,预训练的深度网络仍受基于 RGB 的模型偏置影响,可能导致次优解。本文提出一种面向 RGB 和深度模态的单模型自监督混合预训练框架,称为 CoMAE。我们的 CoMAE 提出一种课程学习策略,以统一两种流行的自监督表示学习算法:对比学习和掩码图像建模。具体而言,我们首先构建一个块级对齐任务,通过跨模态对比学习预训练两个模态共享的单一编码器。然后,将预训练的对比编码器送入多模态掩码自编码器,从生成式视角捕获更细粒度的上下文特征。此外,我们无需融合模块的单模型设计非常灵活且鲁棒,可在训练和测试阶段泛化到单模态场景。在 SUN RGB-D 和 NYUDv2 数据集上的大量实验证明了我们的 CoMAE 在 RGB 和深度表示学习上的有效性。另外,我们的实验结果表明 CoMAE 是一个数据高效的表示学习器。尽管我们仅使用小规模无标签训练集进行预训练,我们的 CoMAE 预训练模型仍可与使用额外大规模有监督 RGB 数据集预训练的最先进方法相竞争。代码将发布于 https://github.com/MCG-NJU/CoMAE。
引用
@article{arxiv.2302.06148,
title = {CoMAE: Single Model Hybrid Pre-training on Small-Scale RGB-D Datasets},
author = {Jiange Yang and Sheng Guo and Gangshan Wu and Limin Wang},
journal= {arXiv preprint arXiv:2302.06148},
year = {2023}
}
备注
10 pages(including references),5 figures, Accept by Thirty-Seventh AAAI Conference on Artificial Intelligence (AAAI 2023)