GRADE:量化文本到图像模型中的样本多样性
计算机视觉与模式识别
2025-03-12 v2
摘要
我们引入了 GRADE,一种用于量化文本到图像模型中样本多样性的自动方法。我们的方法利用嵌入在大语言模型和视觉问答系统中的世界知识,来识别相关的概念特定多样性轴(例如,对于概念“饼干”的“形状”)。然后,它估计概念及其属性的频率分布,并使用熵来量化多样性。我们使用 GRADE 测量了 12 个模型在总共 720K 张图像上的多样性,结果显示所有模型都表现出有限的变化,且更强大的模型明显退化。此外,我们发现模型经常表现出默认行为,即模型持续生成具有相同属性的概念(例如,98% 的饼干是圆形的)。最后,我们表明多样性低的一个关键原因是训练数据中描述不充分的提示词。我们的工作提出了一种自动的、语义驱动的方法来衡量样本多样性,并揭示了文本到图像模型中惊人的同质化现象。
引用
@article{arxiv.2410.22592,
title = {GRADE: Quantifying Sample Diversity in Text-to-Image Models},
author = {Royi Rassin and Aviv Slobodkin and Shauli Ravfogel and Yanai Elazar and Yoav Goldberg},
journal= {arXiv preprint arXiv:2410.22592},
year = {2025}
}
备注
For project page and code see https://royira.github.io/GRADE