MagicMirror:面向文本到图像生成的大规模细粒度人工智能评估基准
计算机视觉与模式识别
2025-09-15 v1
摘要
文本到图像(T2I)生成在指令遵循和审美方面取得了显著进展。然而,仍普遍存在物理性人工智能,如解剖和结构缺陷,这些缺陷严重影响感知质量并限制了应用。鉴于这些人工智能的多样性和复杂性,目前缺乏系统且细粒度的评估框架。为填补这一空白,我们引入了 MagicMirror—a 全面的人工智能评估框架。我们首先建立了生成图像人工智能的详细分类法。根据这一分类法,我们手动标注了 MagicData340K——首个人工标注的大规模 34 万张生成图像,包含细粒度人工智能标签。基于该数据集,我们训练了 MagicAssessor—a 视觉语言模型(VLM),提供详细的评估和相应标签。为克服类别不平衡和奖励作弊等挑战,我们设计了一种新颖的数据抽样策略和多级奖励系统用于 Group Relative Policy Optimization(GRPO)。最后,我们利用 MagicAssessor 构建了 MagicBench—an用于评估当前 T2I 模型图像人工智能的自动化基准。我们的评估显示,尽管广泛采用,即使是顶级模型如 GPT-image-1 也始终受到显著人工智能的困扰,这凸显了人工智能减少是未来 T2I 开发的关键前沿。项目页面:https://wj-inf.github.io/MagicMirror-page/。
引用
@article{arxiv.2509.10260,
title = {MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation},
author = {Jia Wang and Jie Hu and Xiaoqi Ma and Hanghang Ma and Yanbing Zeng and Xiaoming Wei},
journal= {arXiv preprint arXiv:2509.10260},
year = {2025}
}