OpenGPT-4o-Image:面向高级图像生成与编辑的综合性数据集
计算机视觉与模式识别
2025-09-30 v1 人工智能
摘要
用于图像生成与编辑的统一多模态模型的性能,从根本上受限于其训练数据的质量与全面性。现有数据集虽已涵盖风格迁移和简单物体操作等基础任务,但往往缺乏真实世界应用所需的系统性结构与具有挑战性的场景。为解决这一瓶颈,我们引入了 OpenGPT-4o-Image,这是一个采用将分层任务分类法与自动化数据生成相结合的新颖方法构建的大规模数据集。我们的分类体系不仅包含文本渲染和风格控制等基础能力,还引入了极具实用性且具挑战性的类别,例如用于化学插图的科学图像,以及需要同时执行多个操作的复杂指令编辑。通过利用结构化资源池与 GPT-4o 的自动化流程,我们生成了 80k 个具有受控多样性的高质量指令-图像对,涵盖 11 个主要领域和 51 个子任务。大量实验表明,在我们的数据集上对领先模型进行微调,在多个基准测试中均取得了显著的性能提升,在编辑任务(ImgEdit-Bench 上的 UniWorld-V1)上提升达 18%,在生成任务(GenEval 上的 Harmon)上提升达 13%。我们的工作表明,系统性的数据构建是推进多模态 AI 能力的关键。
引用
@article{arxiv.2509.24900,
title = {OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing},
author = {Zhihong Chen and Xuehai Bai and Yang Shi and Chaoyou Fu and Huanyu Zhang and Haotian Wang and Xiaoyan Sun and Zhang Zhang and Liang Wang and Yuanxing Zhang and Pengfei Wan and Yi-Fan Zhang},
journal= {arXiv preprint arXiv:2509.24900},
year = {2025}
}