中文

如果我们用LLaMA-3为数十亿网络图像重新生成描述会怎样?

计算机视觉与模式识别 2024-06-19 v2 计算与语言

摘要

网络爬取的图像-文本对本质上带有噪声。先前的研究表明,对这些对的文本描述进行语义对齐和丰富可以显著提升各种视觉-语言任务的模型训练,特别是文本到图像的生成。然而,该领域的大规模研究仍然主要闭源。我们的论文旨在弥合这一社区努力,利用强大且开源的LLaMA-3(一种GPT-4级别的LLM)。我们的重新描述流程很简单:首先,我们微调一个由LLaMA-3-8B驱动的LLaVA-1.5,然后使用它为DataComp-1B数据集中的13亿张图像重新生成描述。我们的实证结果证实,这个增强后的数据集Recap-DataComp-1B在训练先进的视觉-语言模型方面提供了显著优势。对于像CLIP这样的判别模型,我们观察到在跨模态检索任务中零样本性能的提升。对于像文本到图像扩散Transformer这样的生成模型,生成的图像在遵循用户文本指令方面表现出显著改进,尤其是在处理复杂查询时。我们的项目页面是 https://www.haqtu.me/Recap-Datacomp-1B/。

关键词

引用

@article{arxiv.2406.08478,
  title  = {What If We Recaption Billions of Web Images with LLaMA-3?},
  author = {Xianhang Li and Haoqin Tu and Mude Hui and Zeyu Wang and Bingchen Zhao and Junfei Xiao and Sucheng Ren and Jieru Mei and Qing Liu and Huangjie Zheng and Yuyin Zhou and Cihang Xie},
  journal= {arXiv preprint arXiv:2406.08478},
  year   = {2024}
}

备注

First five authors contributed equally