图像描述天然是文本到图像模型的提示
计算机视觉与模式识别
2025-06-24 v2 人工智能
机器学习
摘要
随着人工智能生成内容(AIGC)的快速发展,由于数据稀缺与隐私泄露问题,在合成数据上训练模型已成为常见做法。鉴于真实图像所承载的海量多样信息,文本到图像生成模型难以通过手工提示合成信息丰富的训练数据。考虑到大型生成模型的出色能力,此类模型能否借助恰当提示直接为预测任务合成良好的训练图像?我们通过提出一种简单而有效的方法对这一问题给出肯定回答,并以 ImageNet 分类进行验证。具体而言,我们用先进的描述模型为每张真实图像生成描述,从而获得提取类别相关信息并澄清类名多义性的信息丰富且忠实的提示。将图像描述与类名拼接以提示生成模型进行训练图像合成。我们表明,这种简单的描述引入显著提升了合成数据的信息丰富度,从而增强下游模型的泛化能力。更重要的是,除在数据增强与隐私保护上的改进外,我们的实验证明合成图像在分布外鲁棒性上可超越真实数据。
引用
@article{arxiv.2307.08526,
title = {Image Captions are Natural Prompts for Text-to-Image Models},
author = {Shiye Lei and Hao Chen and Sen Zhang and Bo Zhao and Dacheng Tao},
journal= {arXiv preprint arXiv:2307.08526},
year = {2025}
}
备注
31 pages, 2 figure, 15 tables. Codes are available at https://github.com/LeavesLei/Caption_in_Prompt