DIMCIM:面向文本到图像生成模型的默认模式多样性与泛化性定量评估框架
计算机视觉与模式识别
2025-06-06 v1
摘要
近年来,文本到图像(T2I)模型在质量和一致性方面取得了显著进展,但以牺牲表征多样性为代价。虽然已有自动评估方法用于基准测试模型多样性,但要么需要参考图像数据集,要么缺乏对所测度量多样性类型的具体说明,限制了其可适应性和可解释性。为此,我们引入“Does-it/Can-it”框架,DIM-CIM,作为默认模式多样性(“模型是否生成具有预期属性的图像?”)和泛化能力(“模型是否为特定概念生成多样化属性?”)的无参考测度。我们构建了 COCO-DIMCIM 基准,采用 COCO 概念和标题作为种子,并由大语言模型增强。使用 COCO-DIMCIM,我们发现广泛使用的模型在参数规模从 15B 增至 81B 时,泛化能力提升但默认模式多样性下降。DIMCIM 还识别了细粒度的失败案例,例如某些属性在通用提示下被生成,但在明确请求时很少被生成。最后,我们使用 DIMCIM 对 T2I 模型的训练数据进行评估,发现训练图像的多样性与默认模式多样性之间存在 0.85 的相关性。我们的工作提供了一个灵活且可解释的框架,用于评估 T2I 模型的多样性和泛化性,使我们能够更全面地理解模型性能。
引用
@article{arxiv.2506.05108,
title = {DIMCIM: A Quantitative Evaluation Framework for Default-mode Diversity and Generalization in Text-to-Image Generative Models},
author = {Revant Teotia and Candace Ross and Karen Ullrich and Sumit Chopra and Adriana Romero-Soriano and Melissa Hall and Matthew J. Muckley},
journal= {arXiv preprint arXiv:2506.05108},
year = {2025}
}