如何训练你的文本到图像模型:评估合成训练标题的设计选择
计算机视觉与模式识别
2025-06-23 v1 人工智能
机器学习
摘要
训练数据是任何成功文本到图像模型的核心。图像文本的质量和描述性对于模型性能至关重要。鉴于网络抓取数据集的噪声和不一致性,最近的工作转向使用合成训练标题。虽然这种设置通常被认为会产生更强大的模型,但当前文献没有提供关于其设计选择的任何见解。本研究通过系统性地检验不同的合成标题策略如何影响文本到图像模型的下游性能来弥合这一差距。我们的实验表明,密集且高质量的标题提高了文本对齐,但可能在输出美学和多样性方面带来权衡。相反,随机长度的标题在美学和对齐之间实现了平衡的改进,而不会损害样本多样性。我们还展示了 varying caption 分布对训练模型输出偏差引入显著变化的影响。我们的发现凸显了标题设计在实现最佳模型性能方面的重要性,并为更有效的文本到图像生成训练数据策略提供了实用见解。
引用
@article{arxiv.2506.16679,
title = {How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions},
author = {Manuel Brack and Sudeep Katakol and Felix Friedrich and Patrick Schramowski and Hareesh Ravi and Kristian Kersting and Ajinkya Kale},
journal= {arXiv preprint arXiv:2506.16679},
year = {2025}
}