文澜:通过大规模多模态预训练连接视觉与语言
计算机视觉与模式识别
2021-07-09 v6 信息检索
摘要
近年来,多模态预训练模型被广泛探索以连接视觉与语言。然而,其中多数通过假设文本与图像模态间存在强语义关联,显式建模图文对之间的跨模态交互。由于该强假设在真实场景中常不成立,我们选择对大规模多模态预训练隐式建模跨模态关联,这也是我们团队牵头的中国项目“文澜”的重点。具体地,在图文对弱关联假设下,我们在跨模态对比学习框架内提出称为 BriVL 的双塔预训练模型。与采用简单对比学习方法的 OpenAI CLIP 不同,我们通过将最新方法 MoCo 适配到跨模态场景而设计了更先进的算法。通过构建基于队列的大型字典,我们的 BriVL 能在有限 GPU 资源下纳入更多负样本。我们进一步构建了用于预训练 BriVL 模型的大型中文多源图文数据集 RUC-CAS-WenLan。大量实验表明,预训练的 BriVL 模型在各种下游任务上均优于 UNITER 和 OpenAI CLIP。
引用
@article{arxiv.2103.06561,
title = {WenLan: Bridging Vision and Language by Large-Scale Multi-Modal Pre-Training},
author = {Yuqi Huo and Manli Zhang and Guangzhen Liu and Haoyu Lu and Yizhao Gao and Guoxing Yang and Jingyuan Wen and Heng Zhang and Baogui Xu and Weihao Zheng and Zongzheng Xi and Yueqian Yang and Anwen Hu and Jinming Zhao and Ruichen Li and Yida Zhao and Liang Zhang and Yuqing Song and Xin Hong and Wanqing Cui and Danyang Hou and Yingyan Li and Junyi Li and Peiyu Liu and Zheng Gong and Chuhao Jin and Yuchong Sun and Shizhe Chen and Zhiwu Lu and Zhicheng Dou and Qin Jin and Yanyan Lan and Wayne Xin Zhao and Ruihua Song and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2103.06561},
year = {2021}
}
备注
This paper is the outcome of the Chinese multi-modal pre-training project called 'WenLan'