中文

GPT-ImgEval:诊断 GPT-4o 图像生成能力的全面基准

计算机视觉与模式识别 2025-05-05 v3

摘要

OpenAI GPT-4o 模型的最新突破在图像生成与编辑方面展现出惊人的能力,引发了社区的广泛关注。本技术报告提出首个评估基准(命名为 GPT-ImgEval),从三个关键维度对 GPT-4o 的性能进行定量与定性诊断:(1) 生成质量,(2) 编辑熟练度,(3) 基于世界知识的语义合成。在所有三个任务中,GPT-4o 均展示出强劲性能,显著超越现有方法在图像生成控制与输出质量方面的表现,同时展现出卓越的知识推理能力。进一步地,基于 GPT-4o 生成的数据,我们提出一种基于分类模型的方案,以探究 GPT-4o 底层架构,其中经验结果表明该模型由自回归 (AR) 模块与基于扩散的解码头组合而成,而非类似 VAR 的架构。我们也对 GPT-4o 的整体架构作出完整推测。此外,我们进行一系列分析,以识别并可视化 GPT-4o 特定的局限性以及其图像生成中常见的合成性artifact。我们还比较了 GPT-4o 与 Gemini 2.0 Flash 在多轮图像编辑中的表现,并讨论了 GPT-4o 输出的安全性问题,尤其是其输出是否易被现有图像取证模型检测到。我们希望本工作能提供宝贵洞察,为未来研究提供可靠基准,以促进图像生成领域及更广泛领域的可重复性研究与创新加速。用于评估 GPT-4o 的代码与数据集可在 https://github.com/PicoTrex/GPT-ImgEval 查阅。

关键词

引用

@article{arxiv.2504.02782,
  title  = {GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation},
  author = {Zhiyuan Yan and Junyan Ye and Weijia Li and Zilong Huang and Shenghai Yuan and Xiangyang He and Kaiqing Lin and Jun He and Conghui He and Li Yuan},
  journal= {arXiv preprint arXiv:2504.02782},
  year   = {2025}
}