迈向统一基础模型:在图像与文本非配对数据上联合预训练 Transformer
计算机视觉与模式识别
2021-12-15 v1 机器学习
摘要
本文探讨了构建可适配纯视觉与纯文本任务的统一基础模型的可能性。从 BERT 和 ViT 出发,我们设计了一个由模态特定分词器、共享 Transformer 编码器和任务特定输出头组成的统一 Transformer。为在所提模型的图像与文本非配对数据上高效联合预训练,我们提出两种新技术:(i) 采用分别训练的 BERT 和 ViT 模型作为教师,并应用知识蒸馏为联合训练提供额外且准确的监督信号;(ii) 提出一种新颖的梯度掩码策略,以平衡来自图像与文本预训练损失的参数更新。我们分别通过在图像分类任务和自然语言理解任务上微调该联合预训练的 Transformer 来评估它。实验表明,所得统一基础 Transformer 在纯视觉与纯文本任务上均表现惊人地好,且所提知识蒸馏与梯度掩码策略能有效提升性能,逼近分别训练模型的水平。
引用
@article{arxiv.2112.07074,
title = {Towards a Unified Foundation Model: Jointly Pre-Training Transformers on Unpaired Images and Text},
author = {Qing Li and Boqing Gong and Yin Cui and Dan Kondratyuk and Xianzhi Du and Ming-Hsuan Yang and Matthew Brown},
journal= {arXiv preprint arXiv:2112.07074},
year = {2021}
}
备注
preliminary work