中文

ImageNet 能否支撑文本到图像生成?

计算机视觉与模式识别 2025-10-03 v3

摘要

近期文本到图像(T2I)生成模型通过在十亿级数据集上训练取得了显著成就,遵循“规模越大越好”的范式,这一范式优先考虑数据规模而非获取方式(封闭 vs 开放)以及可重复性(数据衰减 vs established collections)。我们挑战这一既定范式,通过证明仅使用经过精心设计的文本和图像增强处理的 ImageNet 即可实现大规模网络爬虫集合训练的模型性能。我们的方法在 GenEval 上实现比 SD-XL 提升 6% 的总体得分,在 DPGBench 上提升 5%,同时仅使用 1/10 参数和 1/1000 训练图像。我们还表明,ImageNet 预训练模型可在特定任务数据集上微调(如高分辨率审美应用),取得良好结果,表明 ImageNet 足以获取通用能力。这为更可重复的研究提供了可能,因为 ImageNet 广泛可用,且提出的标准化训练 setup 只需 500 小时 H100 即可训练一个文本到图像模型。

关键词

引用

@article{arxiv.2502.21318,
  title  = {How far can we go with ImageNet for Text-to-Image generation?},
  author = {L. Degeorge and A. Ghosh and N. Dufour and D. Picard and V. Kalogeiton},
  journal= {arXiv preprint arXiv:2502.21318},
  year   = {2025}
}