中文

M6:一个中文多模态预训练模型

计算与语言 2021-06-01 v4

摘要

本工作中,我们构建了中文多模态预训练的最大数据集,包含超过 1.9TB 图像与 292GB 文本,覆盖广泛领域。我们提出一种跨模态预训练方法 M6,意指多模态到多模态多任务巨型Transformer(Multi-Modality to Multi-Modality Multitask Mega-transformer),用于对单模态与多模态数据进行统一预训练。我们将模型规模扩展至 100 亿与 1000 亿参数,构建了中文最大的预训练模型。我们将该模型应用于一系列下游任务,并与强基线相比展现出卓越性能。此外,我们专门设计了文本引导图像生成的下游任务,并显示微调后的 M6 可生成具有高分辨率与丰富细节的优质图像。

关键词

引用

@article{arxiv.2103.00823,
  title  = {M6: A Chinese Multimodal Pretrainer},
  author = {Junyang Lin and Rui Men and An Yang and Chang Zhou and Ming Ding and Yichang Zhang and Peng Wang and Ang Wang and Le Jiang and Xianyan Jia and Jie Zhang and Jianwei Zhang and Xu Zou and Zhikang Li and Xiaodong Deng and Jie Liu and Jinbao Xue and Huiling Zhou and Jianxin Ma and Jin Yu and Yong Li and Wei Lin and Jingren Zhou and Jie Tang and Hongxia Yang},
  journal= {arXiv preprint arXiv:2103.00823},
  year   = {2021}
}

备注

12 pages, technical report. Extension of paper "M6" accepted to KDD 2021