中文

Synth$^2$:利用合成标题与图像嵌入增强视觉-语言模型

计算机视觉与模式识别 2024-06-10 v2 人工智能

摘要

创建高质量的人工标注图像-标题数据集是视觉-语言模型(VLMs)发展中的一个重大瓶颈。在本工作中,我们研究了一种利用大语言模型(LLMs)和图像生成模型的优势来创建合成图文对,以实现高效且有效的 VLM 训练的方法。我们的方法采用预训练的文本到图像模型,从 LLM 生成的标题中合成图像嵌入。尽管文本到图像模型和 VLM 最初在相同的数据上训练,我们的方法利用了图像生成器创造新组合的能力,使得合成的图像嵌入超越了原始数据集的局限。大量实验表明,在合成数据上微调的 VLM 取得了与仅使用人工标注数据训练的模型相当的性能,同时所需的数据量显著减少。此外,我们对标题进行了一系列分析,揭示了语义多样性和平衡是实现更好下游性能的关键因素。最后,我们展示了在图像嵌入空间中合成图像比在像素空间中合成快 25%。我们相信,我们的工作不仅解决了 VLM 训练中的一个重大挑战,还为开发自我改进的多模态模型开辟了有前景的途径。

关键词

引用

@article{arxiv.2403.07750,
  title  = {Synth$^2$: Boosting Visual-Language Models with Synthetic Captions and Image Embeddings},
  author = {Sahand Sharifzadeh and Christos Kaplanis and Shreya Pathak and Dharshan Kumaran and Anastasija Ilic and Jovana Mitrovic and Charles Blundell and Andrea Banino},
  journal= {arXiv preprint arXiv:2403.07750},
  year   = {2024}
}

备注

9 pages, 6 figures