中文

基于CLIPLoss和范数的多模态对比学习数据选择方法

机器学习 2024-12-23 v2 计算机视觉与模式识别

摘要

数据选择已成为大规模视觉-语言模型预训练(例如CLIP)的核心问题,尤其是在使用噪声网络策划数据集时。三种主要的数据选择方法是:(1)利用外部非CLIP模型辅助数据选择,(2)训练新的CLIP风格嵌入模型,该模型比原始OpenAI CLIP模型更有效地选择高质量数据,以及(3)设计更好的度量或策略,这些度量或策略普遍适用于任何CLIP嵌入,而不需要特定的模型属性(例如,CLIPScore是一种流行的度量)。虽然前两种方法已被广泛研究,但第三种方法仍未得到充分探索。在本文中,我们通过提出两种新方法来推进第三种方法。首先,不同于仅考虑单个样本中两种模态之间对齐的经典CLIP分数,我们引入了代理CLIP损失(s-CLIPLoss),这是一种受CLIP损失启发的方法,它将一个样本与其对比对之间的对齐作为额外的归一化项,以实现更好的质量度量。其次,当下游任务已知时,我们提出了一种新的基于范数的度量NormSim,用于测量预训练数据与目标数据之间的相似性。我们在数据选择基准DataComp上测试了我们的方法。与仅使用OpenAI的CLIP-L/14的最佳基线相比,我们的方法在ImageNet-1k上提高了5.3%,在38个下游评估任务上提高了2.8%。此外,s-CLIPLoss和NormSim都与现有技术兼容。通过将我们的方法与当前最佳方法DFN和HYPE相结合,我们可以将下游任务的平均性能提升0.9%,在DataComp-medium基准上实现了新的最先进水平。

关键词

引用

@article{arxiv.2405.19547,
  title  = {CLIPLoss and Norm-Based Data Selection Methods for Multimodal Contrastive Learning},
  author = {Yiping Wang and Yifang Chen and Wendan Yan and Alex Fang and Wenjing Zhou and Kevin Jamieson and Simon Shaolei Du},
  journal= {arXiv preprint arXiv:2405.19547},
  year   = {2024}
}

备注

This paper supercedes our previous VAS paper (arXiv:2402.02055). It's accepted by NeurIPS2024 as spotlight paper. DataComp benchmark: https://www.datacomp.ai/dcclip/leaderboard.html