中文

MEF:文本到图像模型的系统性评估框架

人工智能 2025-09-23 v1

摘要

文本到图像(T2I)生成的快速进展对评估方法提出了更高的要求。现有的基准测试侧重于客观能力和维度,但缺乏应用场景视角,限制了外部效度。此外,当前评估通常依赖 ELO 进行总体排序或 MOS 进行维度特定评分,但两种方法都有固有缺陷且可解释性有限。因此,我们提出了魔法评估框架(MEF),一种系统且实用的 T2I 模型评估方法。首先,我们提出了一种结构化分类法,涵盖用户场景、元素、元素组合和文本表达形式,以构建 Magic-Bench-377,支持标签级评估并确保用户场景和能力的平衡覆盖。在此基础上,我们结合 ELO 和维度特定 MOS 分别生成模型排序和细粒度评估。这种联合评估方法使我们能够使用多元逻辑回归定量分析每个维度对用户满意度的贡献。将 MEF 应用于当前的 T2I 模型后,我们获得了排行榜和领先模型的关键特征。我们发布了评估框架,并将 Magic-Bench-377 完全开源,以推动视觉生成模型评估的研究。

关键词

引用

@article{arxiv.2509.17907,
  title  = {MEF: A Systematic Evaluation Framework for Text-to-Image Models},
  author = {Xiaojing Dong and Weilin Huang and Liang Li and Yiying Li and Shu Liu and Tongtong Ou and Shuang Ouyang and Yu Tian and Fengxuan Zhao},
  journal= {arXiv preprint arXiv:2509.17907},
  year   = {2025}
}