通过最大化多模态互信息实现全合一预训练
计算机视觉与模式识别
2022-11-22 v2
摘要
为有效挖掘大规模模型的潜力,人们提出了由来自不同来源海量数据支撑的多种预训练策略,包括有监督预训练、弱监督预训练与自监督预训练。已证明结合多种预训练策略及来自不同模态/来源的数据可极大促进大规模模型的训练。然而,当前工作采用多阶段预训练系统,其复杂流程可能增加预训练的不确定性与不稳定性。因此,期望能以单阶段方式整合这些策略。本文中,我们首先提出一个通用的多模态互信息公式作为统一优化目标,并证明所有现有方法均为我们框架的特例。在此统一视角下,我们提出一种全合一单阶段预训练方法,称为最大化多模态互信息预训练(M3I Pre-training)。我们的方法在包括ImageNet分类、COCO目标检测、LVIS长尾目标检测与ADE20k语义分割在内的多种视觉基准上取得了优于以往预训练方法的性能。值得注意的是,我们成功预训练了一个十亿级参数图像骨干网络,并在各基准上取得最先进性能。代码将发布于 https://github.com/OpenGVLab/M3I-Pretraining。
引用
@article{arxiv.2211.09807,
title = {Towards All-in-one Pre-training via Maximizing Multi-modal Mutual Information},
author = {Weijie Su and Xizhou Zhu and Chenxin Tao and Lewei Lu and Bin Li and Gao Huang and Yu Qiao and Xiaogang Wang and Jie Zhou and Jifeng Dai},
journal= {arXiv preprint arXiv:2211.09807},
year = {2022}
}