中文

WuDaoMM:用于预训练模型的大规模多模态数据集

计算机视觉与模式识别 2022-05-03 v5 计算与语言

摘要

与特定领域模型相比,视觉-语言预训练模型(VLPMs)在下游任务上以快速微调过程展现出优越性能。例如,ERNIE-ViL、Oscar 与 UNIMO 采用统一的 transformers 栈架构和大量图文对数据训练 VLPMs,在图文检索(IR 与 TR)、视觉问答(VQA)与图像描述(IC)等下游任务上取得了显著结果。在训练阶段,VLPMs 通常输入多个公开数据集的组合以满足大规模训练数据的需求。然而,由于数据分布在规模、任务类型与质量上的不均衡,使用多数据集混合进行模型训练可能存在问题。本工作中,我们介绍了一个名为 WuDaoMM 的大规模多模态语料库,共包含超过 6.5 亿个图文对。具体而言,约 6 亿对数据收集自多个网页,其中图像与描述呈弱相关性;另外 5000 万强相关图文对收集自一些高质量图文网站。我们还发布了 WuDaoMM 的基础版本,含 500 万强相关图文对,足以支撑常见的跨模态模型预训练。此外,我们训练了一个理解型与一个生成型视觉-语言(VL)模型以检验数据集有效性。结果表明,WuDaoMM 可作为 VLPMs 的高效数据集,尤其适用于文本到图像生成任务中的模型。数据发布于 https://data.wudaoai.cn

关键词

引用

@article{arxiv.2203.11480,
  title  = {WuDaoMM: A large-scale Multi-Modal Dataset for Pre-training models},
  author = {Sha Yuan and Shuai Zhao and Jiahong Leng and Zhao Xue and Hanyu Zhao and Peiyu Liu and Zheng Gong and Wayne Xin Zhao and Junyi Li and Jie Tang},
  journal= {arXiv preprint arXiv:2203.11480},
  year   = {2022}
}

备注

Some data problems cannot be obtained