中文

MMMG: 大型、跨学科、多层次知识图像生成基准

计算机视觉与模式识别 2026-01-07 v2 计算与语言

摘要

本文介绍了知识图像生成作为一种新任务,以及大型跨学科多层次知识图像生成基准(MMMG),以探索图像生成模型的推理能力。知识图像一直是人类文明和人类学习机制的核心 -- 这一点通过双编码理论和图像优势效应得到强调。生成此类图像具有挑战性,需要融合世界知识与像素级对齐的多模态推理,以创建清晰的解释性视觉。为实现全面评估,MMMG提供了4456对经专家验证(知识)图像-文本提示配对,涵盖10个学科、6个教育水平,以及图表、图示和思维导图等多种知识格式。为消除评估中的混乱复杂度,我们采用统一的知识图谱(KG)表示。每个KG明确界定了目标图像的核心实体及其依赖关系。我们进一步引入MMMG-Score来评估生成的知识图像。该指标结合了通过KG之间编辑距离衡量的事实忠实度,以及视觉清晰度评估。对16种最先进文本到图像生成模型进行全面评估,揭示了严重的推理缺陷 -- 实体忠实度低、关系弱、杂乱 -- GPT-4o仅 achieving an MMMG-Score of 50.20,凸显了基准的难度。为推动进一步进展,我们发布了FLUX-Reason (MMMG-Score of 34.45),一种有效且开放的基线方法,将推理LLM与扩散模型结合,在16000个精选知识图像-文本提示配对上进行训练。

关键词

引用

@article{arxiv.2506.10963,
  title  = {MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning},
  author = {Yuxuan Luo and Yuhui Yuan and Junwen Chen and Haonan Cai and Ziyi Yue and Yuwei Yang and Fatima Zohra Daha and Ji Li and Zhouhui Lian},
  journal= {arXiv preprint arXiv:2506.10963},
  year   = {2026}
}

备注

85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/