中文

FFF:修复对比预训练中的根基缺陷,显著提升视觉-语言模型性能

计算机视觉与模式识别 2024-05-17 v1 人工智能

摘要

尽管噪声和标题质量一直被认为是影响视觉-语言对比预训练的重要因素,但本文指出,通过解决此类问题来充分发挥训练过程潜力尚未被实现。具体而言,我们首先研究和分析影响训练的两个问题:负样本对的错误分配以及标题质量和多样性不足。随后,我们设计了有效的解决方案,这些解决方案本质上需要使用多个真实正样本对进行训练。最后,我们提出使用 sigmoid loss 来满足这一要求。我们在图像识别(在 11 个数据集上平均提升约 6%)和图像检索(在 Flickr30k 上提升约 19%,在 MSCOCO 上提升约 15%)方面均取得了显著的性能提升。

关键词

引用

@article{arxiv.2405.10286,
  title  = {FFF: Fixing Flawed Foundations in contrastive pre-training results in very strong Vision-Language models},
  author = {Adrian Bulat and Yassine Ouali and Georgios Tzimiropoulos},
  journal= {arXiv preprint arXiv:2405.10286},
  year   = {2024}
}

备注

Accepted at CVPR 2024