中文

SynthCLIP:我们是否已准备好进行完全合成的 CLIP 训练?

计算机视觉与模式识别 2024-07-19 v2 人工智能 机器学习

摘要

我们提出了 SynthCLIP,这是一个在完全合成的文本 - 图像对上训练的 CLIP 模型。利用最新的文本到图像(TTI)网络和大语言模型(LLM),我们在无需人工干预的情况下大规模生成了合成图像及其对应标题的数据集。在这项工作中,我们对在合成数据上训练的 CLIP 模型进行了分析。我们提供了关于数据生成策略、所需样本数量、扩展趋势以及 resulting 属性的见解。我们还介绍了 SynthCI-30M,这是一个包含 3000 万张带标题图像的纯合成数据集。我们的代码、训练模型和数据已在 https://github.com/hammoudhasan/SynthCLIP 开源。

关键词

引用

@article{arxiv.2402.01832,
  title  = {SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?},
  author = {Hasan Abed Al Kader Hammoud and Hani Itani and Fabio Pizzati and Philip Torr and Adel Bibi and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2402.01832},
  year   = {2024}
}

备注

Under review