中文

结构化标题提升文本到图像模型中的提示遵循性(Re-LAION-Caption 19M)

计算机视觉与模式识别 2025-07-09 v1 人工智能 计算与语言 机器学习

摘要

我们指出,生成式文本到图像模型常因大规模数据集如 LAION-5B 的噪声和非结构化 nature 而在提示遵循方面存在困难,这迫使用户依赖大量的提示工程才能引导模型产生理想输出。在本工作中,我们提出在训练过程中强制执行一致的标题结构可显著提高模型的可控性和对齐性。我们引入 Re-LAION-Caption 19M,这是一个来自 Re-LAION-5B 的高质量子集,包含 1900 万张 1024x1024 图像,标题由基于 Mistral 7B Instruct 的 LLaVA-Next 模型生成。每个标题遵循四部分模板:主体、场景、美学和摄影细节。我们使用结构化和随机混洗后的标题分别对 PixArt-Σ\Sigma 和 Stable Diffusion 2 进行微调,结果显示结构化版本在使用视觉问答(VQA)模型评估的文本图像对齐分数上 consistently 高于随机混洗版本。该数据集已公开于 https://huggingface.co/datasets/supermodelresearch/Re-LAION-Caption19M。

关键词

引用

@article{arxiv.2507.05300,
  title  = {Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)},
  author = {Nicholas Merchant and Haitz Sáez de Ocáriz Borde and Andrei Cristian Popescu and Carlos Garcia Jurado Suarez},
  journal= {arXiv preprint arXiv:2507.05300},
  year   = {2025}
}

备注

7-page main paper + appendix, 18 figures