悟空:一个亿级大规模中文跨模态预训练基准
计算机视觉与模式识别
2022-09-30 v4 机器学习
摘要
视觉-语言预训练(VLP)模型在各种下游任务上展现了卓越性能。其成功严重依赖于预训练跨模态数据集的规模。然而,中文大规模数据集与基准的缺乏阻碍了中文 VLP 模型的发展及更广泛的多语言应用。本工作中,我们发布了一个名为悟空的大规模中文跨模态数据集,包含从网络收集的 1 亿个中文图文对。悟空旨在为不同多模态预训练方法提供基准,以促进 VLP 研究与社区发展。此外,我们发布了一组使用不同图像编码器(ViT-B/ViT-L/SwinT)预训练的模型,并将锁定图像文本微调、对比学习中 token 级相似度和减少 token 交互等先进预训练技术引入 VLP。我们还提供了大量实验以及对不同下游任务的基准测试,包括一个新的最大规模人工验证图文测试数据集。实验表明,悟空可作为有前景的中文预训练数据集和不同跨模态学习方法的基准。在 10 个数据集的零样本图像分类任务上, 取得 73.03% 的平均准确率。对于图文检索任务,其在 AIC-ICC 上取得 71.6% 的平均召回率,比 WenLan 2.0 高 12.9%。同时,我们的悟空模型也在多个数据集上与其他变体在下游任务进行了基准测试,例如 Flickr8K-CN、Flickr-30K-CN、COCO-CN 等。更多信息参见:https://wukong-dataset.github.io/wukong-dataset/。
引用
@article{arxiv.2202.06767,
title = {Wukong: A 100 Million Large-scale Chinese Cross-modal Pre-training Benchmark},
author = {Jiaxi Gu and Xiaojun Meng and Guansong Lu and Lu Hou and Minzhe Niu and Xiaodan Liang and Lewei Yao and Runhui Huang and Wei Zhang and Xin Jiang and Chunjing Xu and Hang Xu},
journal= {arXiv preprint arXiv:2202.06767},
year = {2022}
}
备注
Accepted by NeurIPS 2022 Track Datasets and Benchmarks