VLMo:基于混合模态专家的统一视觉-语言预训练
计算机视觉与模式识别
2022-05-30 v2 计算与语言
机器学习
摘要
我们提出一种统一的视觉-语言预训练模型(VLMo),其通过模块化 Transformer 网络联合学习双编码器与融合编码器。具体而言,我们引入混合模态专家(MoME)Transformer,其中每个块包含一组模态特定专家与一个共享自注意力层。由于 MoME 的建模灵活性,预训练的 VLMo 可作为融合编码器微调用于视觉-语言分类任务,或用作双编码器以进行高效图文检索。此外,我们提出一种分阶段预训练策略,除图文对之外还有效利用了大规模仅图像与仅文本数据。实验结果表明,VLMo 在多种视觉-语言任务上取得 SOTA 结果,包括 VQA、NLVR2 与图文检索。代码与预训练模型可在 https://aka.ms/vlmo 获取。
引用
@article{arxiv.2111.02358,
title = {VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts},
author = {Hangbo Bao and Wenhui Wang and Li Dong and Qiang Liu and Owais Khan Mohammed and Kriti Aggarwal and Subhojit Som and Furu Wei},
journal= {arXiv preprint arXiv:2111.02358},
year = {2022}
}
备注
Work in progress