中文

M2-Encoder:通过大规模高效预训练提升双语图像-文本理解能力

计算机视觉与模式识别 2024-02-06 v2 人工智能

摘要

视觉-语言基础模型如CLIP已彻底革新了人工智能领域。然而,支持中英文双语的视觉-语言模型因大规模预训练数据集的相对缺乏而滞后于其他语言。为此,我们引入了包含超过60亿图像-文本对的综合性双语(中文-英文)数据集BM-6B,旨在增强多模态基础模型对两种语言中图像的理解能力。为处理此数据集规模,我们提出了一种新颖的分组聚合方法,用于图像-文本对比损失计算,该方法显著降低了通信开销和GPU内存需求,促进了训练速度提升60%。我们在BM-6B上对一系列双语图像-文本基础模型进行了预训练,增强了其细粒度理解能力,得到的模型称为M²-Encoder(读作"M平方"),在两种语言中均为多模态检索和分类任务设定了新纪录。值得注意的是,我们最大的M²-Encoder-10B模型在零样本分类设置下,ImageNet和ImageNet-CN上的top-1准确率分别达到88.5%和80.7%,分别超越了之前报告的SOTA方法2.2%和21.1%。M²-Encoder系列是目前最为全面的双语图像-文本基础模型之一,我们将其向研究社区公开,以便进一步探索和发展。

关键词

引用

@article{arxiv.2401.15896,
  title  = {M2-Encoder: Advancing Bilingual Image-Text Understanding by Large-scale Efficient Pretraining},
  author = {Qingpei Guo and Furong Xu and Hanxiao Zhang and Wang Ren and Ziping Ma and Lin Ju and Jian Wang and Jingdong Chen and Ming Yang},
  journal= {arXiv preprint arXiv:2401.15896},
  year   = {2024}
}