中文

Too Large;面向视觉-语言预训练的数据精简

计算机视觉与模式识别 2023-08-21 v3

摘要

本文考察了广泛使用的大规模视觉-语言预训练(VLP)数据集中严重的图像-文本错位与高冗余问题。为解决这些问题,我们提出了一种高效且简洁的视觉-语言学习算法 TL;DR,旨在将现有大规模 VLP 数据压缩为小规模高质量集合。我们的方法包含两个主要步骤。首先,开发一个基于码本编码器-解码器的描述生成器以筛选代表性样本。其次,为所选样本生成新描述以补充原始描述,在保持独特性的同时缓解文本-图像错位问题。由此,TL;DR 使我们能够将大数据集精简为小规模高质量数据,可作为替代的预训练数据集。该算法显著加快了耗时的预训练过程。具体而言,TL;DR 能以高比例压缩主流 VLP 数据集,例如将清洗良好的 CC3M 数据集从 2.82M 缩减至 0.67M(\sim24%),将含噪的 YFCC15M 从 15M 缩减至 2.5M(\sim16.7%)。在七个下游任务上基于三种流行 VLP 模型的充分实验表明,在 TL;DR 提供的压缩数据集上训练的 VLP 模型可取得与全量数据集训练相似甚至更优的结果。代码将发布于 \url{https://github.com/showlab/datacentric.vlp}。

关键词

引用

@article{arxiv.2305.20087,
  title  = {Too Large; Data Reduction for Vision-Language Pre-Training},
  author = {Alex Jinpeng Wang and Kevin Qinghong Lin and David Junhao Zhang and Stan Weixian Lei and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2305.20087},
  year   = {2023}
}

备注

ICCV2023. Code: https://github.com/showlab/datacentric.vlp