CCMB:一个大规模中文跨模态基准
计算机视觉与模式识别
2023-11-09 v6 人工智能
摘要
大规模数据集上的视觉-语言预训练(VLP)在各种下游任务上展现了最佳性能。与大量可用的英文语料基准相比,带有中文语料的大规模预训练数据集和下游数据集仍很大程度上未被探索。在本工作中,我们为研究社区构建了一个名为 CCMB 的大规模高质量中文跨模态基准,其包含目前最大的公开预训练数据集 Zero 以及五个用于下游任务的人工标注微调数据集。Zero 包含 2.5 亿张图像及配对的 7.5 亿条文本描述,且五个微调数据集中的两个也是目前中文跨模态下游任务中最大的。连同 CCMB,我们还开发了一个名为 R2D2 的 VLP 框架,采用预排序+排序(pre-Ranking + Ranking)策略学习强大的视觉-语言表征,并采用双向蒸馏方法(即目标引导蒸馏与特征引导蒸馏)进一步增强学习能力。利用 Zero 和 R2D2 VLP 框架,我们在图像-文本检索、图像-文本匹配、图像描述、文本到图像生成和零样本图像分类这五类广泛任务的十二个下游数据集上取得了最先进的性能。数据集、模型和代码可在 https://github.com/yuxie11/R2D2 获取。
引用
@article{arxiv.2205.03860,
title = {CCMB: A Large-scale Chinese Cross-modal Benchmark},
author = {Chunyu Xie and Heng Cai and Jincheng Li and Fanjing Kong and Xiaoyu Wu and Jianfei Song and Henrique Morimitsu and Lin Yao and Dexin Wang and Xiangzheng Zhang and Dawei Leng and Baochang Zhang and Xiangyang Ji and Yafeng Deng},
journal= {arXiv preprint arXiv:2205.03860},
year = {2023}
}