ConceptMix++:通过迭代提示优化提升文本到图像基准测试的公平性
计算机视觉与模式识别
2025-07-08 v1 机器学习
摘要
当前文本到图像 (T2I) 基准测试在刚性提示下评估模型,可能低估真实生成能力 due to prompt sensitivity,导致某些模型受益而另一些模型受损。我们提出 ConceptMix++,一种通过迭代提示优化来分离提示措辞与视觉生成能力的框架。基于 ConceptMix,我们的方法引入了多模态优化管道,利用视觉语言模型反馈系统性地优化提示。通过多个扩散模型上的大量实验,我们展示,优化后的提示显著提升了组合生成性能,揭示了以前被隐藏的模型能力,使模型间的公平比较成为可能。我们的分析表明,某些视觉概念——如空间关系和形状——受优化益处更大,表明现有基准测试在这些类别中系统性地低估了模型性能。此外,我们发现优化后的提示在模型之间具有强大的跨模型可迁移性,表明不同模型对有效提示措辞有相似的偏好。这些发现表明,刚性的基准测试方法可能严重低估了模型的实际能力,而我们的框架提供了更准确的评估和对未来发展的见解。
引用
@article{arxiv.2507.03275,
title = {ConceptMix++: Leveling the Playing Field in Text-to-Image Benchmarking via Iterative Prompt Optimization},
author = {Haosheng Gan and Berk Tinaz and Mohammad Shahab Sepehri and Zalan Fabian and Mahdi Soltanolkotabi},
journal= {arXiv preprint arXiv:2507.03275},
year = {2025}
}
备注
An earlier version appeared in the CVPR 2025 Workshop on Generative Models for Computer Vision