多模态语言模型作文本到图像模型评估器
计算机视觉与模式识别
2025-05-14 v2 人工智能
计算与语言
摘要
文本到图像(T2I)生成模型的持续改进导致依赖静态数据集的自动评估基准逐渐过时,这促使研究人员寻找评估 T2I 进展的替代方法。在本文中,我们探索了多模态大语言模型(MLLMs)作为评估智能体的潜力,该智能体与 T2I 模型交互,旨在评估提示-生成一致性和图像美学。我们提出了多模态文本到图像评估(MT2IE)框架,该框架迭代生成用于评估的提示,对生成的图像进行评分,并以远少于现有静态基准所用提示数量的一小部分,实现了与现有基准相当的 T2I 评估匹配。此外,我们表明,MT2IE 的提示-生成一致性分数与人类判断的相关性高于先前文献中引入的分数。MT2IE 生成的提示能够高效探测 T2I 模型性能,仅使用 1/80 的评估提示数量,就产生了与现有基准相同的相对 T2I 模型排名。
引用
@article{arxiv.2505.00759,
title = {Multi-Modal Language Models as Text-to-Image Model Evaluators},
author = {Jiahui Chen and Candace Ross and Reyhane Askari-Hemmat and Koustuv Sinha and Melissa Hall and Michal Drozdzal and Adriana Romero-Soriano},
journal= {arXiv preprint arXiv:2505.00759},
year = {2025}
}