中文

我们是否已经统一了图像生成与理解?关于 GPT-4o 图像生成能力的实证研究

计算机视觉与模式识别 2025-04-14 v1

摘要

OpenAI 的多模态 GPT-4o 在图像生成与编辑方面展现出了卓越能力,但其实现由世界知识驱动的语义合成——即无缝整合领域知识、上下文推理与指令遵循——的能力仍有待证明。在本研究中,我们从三个关键维度系统评估了这些能力:(1) 全局指令遵循,(2) 细粒度编辑精度,以及 (3) 生成后推理。尽管现有基准突显了 GPT-4o 在图像生成与编辑方面的强大能力,但我们的评估揭示了 GPT-4o 持续存在的局限性:该模型经常默认对指令进行字面解释,不一致地应用知识约束,并在条件推理任务中遇到困难。这些发现挑战了关于 GPT-4o 统一理解与生成能力的普遍假设,暴露了其在动态知识整合方面的重大差距。我们的研究呼吁开发更稳健的基准和训练策略,以超越表面层级的对齐,强调上下文感知与推理驱动的多模态生成。

关键词

引用

@article{arxiv.2504.08003,
  title  = {Have we unified image generation and understanding yet? An empirical study of GPT-4o's image generation ability},
  author = {Ning Li and Jingran Zhang and Justin Cui},
  journal= {arXiv preprint arXiv:2504.08003},
  year   = {2025}
}

备注

Early work, technical report