中文

IMAGINE-E:文本到图像模型生成智能评估

计算机视觉与模式识别 2025-01-24 v1 计算与语言 机器学习

摘要

随着扩散模型的快速发展,文本到图像 (T2I) 模型在跟随提示和图像生成方面展现了显著能力。近期推出的模型如 FLUX.1、Ideogram2.0,以及 Dall-E3、Stable Diffusion 3 等,在各种复杂任务中表现卓越,引发关于 T2I 模型是否正向通用应用方向发展的疑问。超越传统图像生成,这些模型在可控生成、图像编辑、视频、音频、3D 和运动生成方面,以及计算机视觉任务如语义分割和深度估计等领域展现出广泛能力。然而,现有评估框架不足以全面评估这些模型在不断扩展的领域中的表现。为全面评估这些模型,我们开发了 IMAGINE-E 并测试了六个突出模型:FLUX.1、Ideogram2.0、Midjourney、Dall-E3、Stable Diffusion 3 和 Jimeng。我们的评估分为五个关键领域:结构化输出生成、真实性与物理一致性、特定领域生成、具挑战性情景生成以及多风格创建任务。该全面评估揭示了每个模型的优势与局限,尤其是 FLUX.1 和 Ideogram2.0 在结构化与特定领域任务中表现突出,凸显了 T2I 模型作为基础 AI 工具的不断拓展的应用前景与潜力。本研究为 T2I 模型当前状态及其演进方向(正向通用可用性)提供了宝贵洞见。评估脚本将在 https://github.com/jylei16/Imagine-e 上发布。

关键词

引用

@article{arxiv.2501.13920,
  title  = {IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models},
  author = {Jiayi Lei and Renrui Zhang and Xiangfei Hu and Weifeng Lin and Zhen Li and Wenjian Sun and Ruoyi Du and Le Zhuo and Zhongyu Li and Xinyue Li and Shitian Zhao and Ziyu Guo and Yiting Lu and Peng Gao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2501.13920},
  year   = {2025}
}

备注

75 pages, 73 figures, Evaluation scripts: https://github.com/jylei16/Imagine-e