扩散优于自回归:文本到图像模型中组合生成能力的评估
计算机视觉与模式识别
2025-03-24 v2
摘要
文本到图像(T2I)生成模型,如Stable Diffusion和DALL-E,在根据文本描述生成高质量、逼真且自然的图像方面表现出卓越的能力。然而,这些模型有时无法准确捕捉输入提示中指定的所有细节,特别是关于实体、属性和空间关系。当提示包含新颖或复杂的组合时,这个问题变得更加突出,导致所谓的组合生成失败模式。最近,一种新的开源基于扩散的T2I模型FLUX被推出,在高质量图像生成方面展示了强大的性能。此外,像LlamaGen这样的自回归T2I模型声称在视觉质量性能上可与基于扩散的模型相媲美。在本研究中,我们使用T2I-CompBench基准测试,评估了这些新推出的模型与既有模型的组合生成能力。我们的发现表明,LlamaGen作为一个普通的自回归模型,在相同的标准(如模型大小和推理时间)下,其在组合生成任务上的表现尚不及最先进的扩散模型。另一方面,开源基于扩散的模型FLUX展现出与最先进的闭源模型DALL-E3相当的组合生成能力。
引用
@article{arxiv.2410.22775,
title = {Diffusion Beats Autoregressive: An Evaluation of Compositional Generation in Text-to-Image Models},
author = {Arash Marioriyad and Parham Rezaei and Mahdieh Soleymani Baghshah and Mohammad Hossein Rohban},
journal= {arXiv preprint arXiv:2410.22775},
year = {2025}
}
备注
NeurIPS 2024 Workshop on Compositional Learning: Perspectives, Methods, and Paths Forward