GPT-4o 原生图像生成的初步探索
计算机视觉与模式识别
2025-05-12 v1 人工智能
图像与视频处理
摘要
最近,OpenAI 解锁了 GPT-4o 的视觉生成能力。它在多模态条件理解和多样化任务指令方面表现出卓越的生成能力。本文旨在探索 GPT-4o 在各种任务中的能力。灵感来自前期研究,我们构建了任务分类框架并精心挑选了测试样本,以进行全面的定性测试。得益于 GPT-4o 强大的多模态理解,其图像生成过程的能力超越了传统图像生成任务。因此,在模型能力维度上,我们评估了其在六个任务类别中的性能:传统图像生成任务、判别性任务、知识驱动的生成、常识驱动的生成、空间感知图像生成和时间感知图像生成。这些任务不仅评估了模型输出的质量和条件对齐性,还深入探讨了 GPT-4o 对现实世界概念的理解。我们的结果显示,GPT-4o 在通用合成任务中表现出色,在文本到图像生成、视觉风格化和低层图像处理方面展现出强大的能力。然而,在精确的空间推理、指令导向的生成和一致的时序预测方面仍存在显著局限。此外,在面对知识密集型或特定领域情境时,如科学插图或数学图表,模型常常会出现幻觉、事实错误或结构不一致。这些发现表明,尽管 GPT-4o 在统一多模态生成方面取得了重大进展,但在可靠应用于专业或安全关键领域之前,仍需走很长的路。
引用
@article{arxiv.2505.05501,
title = {Preliminary Explorations with GPT-4o(mni) Native Image Generation},
author = {Pu Cao and Feng Zhou and Junyi Ji and Qingye Kong and Zhixiang Lv and Mingjian Zhang and Xuekun Zhao and Siqi Wu and Yinghui Lin and Qing Song and Lu Yang},
journal= {arXiv preprint arXiv:2505.05501},
year = {2025}
}