中文

MMIG-Bench:面向多模态图像生成模型的全面且可解释评估

计算机视觉与模式识别 2025-05-29 v2

摘要

最近的多模态图像生成器如 GPT-4o、Gemini 2.0 Flash 和 Gemini 2.5 Pro 在跟随复杂指令、编辑图像和保持概念一致性方面表现出色。然而,它们仍然依赖各异的工具进行评估:缺乏多模态条件的文本到图像 (T2I) 基准测试,或忽视组成语义和常识的定制化图像生成基准测试。我们提出 MMIG-Bench,一个综合性的多模态图像生成基准, 通过将 4,850 个标注详尽的文本提示与 1,750 个跨视角参考图像配对,覆盖 380 个主题,包括人类、动物、物件及艺术风格。MMIG-Bench 配备了三级评估框架:(1) 用于视觉瑕疵和对象身份保持的低级指标;(2) novel Aspect Matching Score (AMS):一种基于 VQA 的中级指标,提供细粒度的提示-图像对齐,显示强烈与人类判断的相关性;(3) 用于审美和人类偏好的高级指标。使用 MMIG-Bench,我们对 17 个最先进模型进行基准测试,包括 Gemini 2.5 Pro、FLUX、DreamBooth 和 IP-Adapter,并用 32k 人类评分验证了我们的指标,深入揭示了架构与数据设计的深刻见解。

关键词

引用

@article{arxiv.2505.19415,
  title  = {MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models},
  author = {Hang Hua and Ziyun Zeng and Yizhi Song and Yunlong Tang and Liu He and Daniel Aliaga and Wei Xiong and Jiebo Luo},
  journal= {arXiv preprint arXiv:2505.19415},
  year   = {2025}
}