VeCLIP:通过视觉丰富描述改进 CLIP 训练
计算机视觉与模式识别
2024-03-15 v3 人工智能
机器学习
摘要
大规模网络爬取数据集是预训练视觉-语言模型(如 CLIP)成功的基础。然而,网络爬取 AltText 固有的噪声与潜在不相关性给精确的图像-文本对齐带来挑战。现有利用大语言模型(LLMs)重写描述的方法已在 CC3M 和 CC12M 等小型精选数据集上展现出前景。本研究引入了一种可扩展的噪声描述重写流水线。与近期 LLM 重写技术不同,我们强调将视觉概念融入描述,称为视觉丰富描述(VeCap)。为确保数据多样性,我们提出一种新颖的混合训练方案,优化 AltText 与新生成 VeCap 的利用。我们展示了该方法在大规模网络爬取数据集上训练 CLIP 的适配,称为 VeCLIP。借助这一高性价比流水线,我们轻松将数据集扩展至 3 亿样本,命名为 VeCap 数据集。我们的结果显示了在图像-文本对齐和整体模型性能上的显著优势。例如,在 12M 设定下,VeCLIP 在 COCO 和 Flickr30k 检索任务中取得高达 +25.2% 的提升。在数据效率方面,VeCLIP 仅使用 vanilla CLIP 的 14% 数据和 ALIGN 的 11% 数据即取得 +3% 提升。我们还注意到 VeCap 数据与其他适用于零样本分类任务的精筛数据集互补。当结合 VeCap 与 DFN 时,我们的模型可在图像-文本检索与零样本分类任务上均取得强劲表现,例如 H/14 模型在 ImageNet 零样本上达到 83.1% 的 accuracy@1。我们在 https://github.com/apple/ml-veclip 发布了预训练模型。
引用
@article{arxiv.2310.07699,
title = {VeCLIP: Improving CLIP Training via Visual-enriched Captions},
author = {Zhengfeng Lai and Haotian Zhang and Bowen Zhang and Wentao Wu and Haoping Bai and Aleksei Timofeev and Xianzhi Du and Zhe Gan and Jiulong Shan and Chen-Nee Chuah and Yinfei Yang and Meng Cao},
journal= {arXiv preprint arXiv:2310.07699},
year = {2024}
}
备注
CV/ML