中文

Sieve:基于图像描述模型的多模态数据集剪枝

计算机视觉与模式识别 2024-03-12 v2

摘要

视觉-语言模型(VLMs)在大规模、多样化且含噪的网络爬取数据集上预训练。这凸显了数据集剪枝的关键需求,因为此类数据集的质量与VLM在下游任务上的性能密切相关。利用预训练模型的CLIPScore仅使用高度对齐样本训练模型是最成功的剪枝方法之一。我们认为该方法存在多处局限,包括:因CLIP在含噪标签上预训练而导致的假阳性与假阴性。我们提出一种名为Sieve的剪枝信号,其采用在小型、多样化且良好对齐的图像-文本对上预训练的图像描述模型所生成的合成描述,来评估含噪图像-文本对的对齐度。为弥合生成描述有限多样性与替代文本(alt-text)高多样性之间的差距,我们在基于无标注文本语料预训练的语言模型嵌入空间中估算语义文本相似度。使用多模态数据集过滤基准DataComp,在38个下游任务上评估时,我们的剪枝方法在中规模和大规模上分别超越CLIPScore达2.6%和1.7%。此外,在检索任务上,Sieve在中规模和大规模上分别带来2.7%和4.5%的显著提升。

关键词

引用

@article{arxiv.2310.02110,
  title  = {Sieve: Multimodal Dataset Pruning Using Image Captioning Models},
  author = {Anas Mahmoud and Mostafa Elhoushi and Amro Abbas and Yu Yang and Newsha Ardalani and Hugh Leather and Ari Morcos},
  journal= {arXiv preprint arXiv:2310.02110},
  year   = {2024}
}

备注

Accepted in CVPR 2024