中文

Conceptual 12M:推进 Web 规模图像-文本预训练以识别长尾视觉概念

计算机视觉与模式识别 2021-03-31 v2 计算与语言

摘要

大规模图像描述与视觉问答数据集的可用性,为近期视觉-语言预训练的成功作出了重要贡献。然而,这些数据集的收集往往继承了来自其原始目标任务(如图像描述生成)的过度限制性要求,限制了所得数据集的规模与多样性。我们进一步推进视觉-语言预训练数据的极限,放宽 Conceptual Captions 3M(CC3M)[Sharma 等,2018] 所使用的数据收集流程,并引入 Conceptual 12M(CC12M),一个包含 1200 万图像-文本对、专用于视觉-语言预训练的数据集。我们对该数据集进行分析,并在多个下游任务上针对 CC3M 评测其有效性,重点强调长尾视觉识别。我们的结果清晰展示了扩大预训练数据规模对视觉-语言任务的益处,这体现在 nocaps 和 Conceptual Captions 基准上取得的新最优(SOTA)结果。

关键词

引用

@article{arxiv.2102.08981,
  title  = {Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts},
  author = {Soravit Changpinyo and Piyush Sharma and Nan Ding and Radu Soricut},
  journal= {arXiv preprint arXiv:2102.08981},
  year   = {2021}
}

备注

IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2021). Our dataset is available at https://github.com/google-research-datasets/conceptual-12m