中文

GPT-IMAGE-EDIT-1.5M:百万规模、GPT 生成的图像数据集

计算机视觉与模式识别 2025-07-29 v1

摘要

近期,GPT-4o 等大型多模态模型的进展为高保真、指令引导的图像编辑设定了新标准。然而,这些模型及其训练数据的专有性质为开源研究造成了显著障碍。为弥合这一差距,我们引入了 GPT-IMAGE-EDIT-1.5M,一个公开可用的大规模图像编辑语料库,包含超过 150 万个高质量三元组(指令、源图像、编辑后图像)。我们利用 GPT-4o 的多功能能力,通过统一和精炼三个流行的图像编辑数据集(OmniEdit、HQ-Edit 和 UltraEdit)来系统地构建该数据集。具体而言,我们的方法包括:1)重新生成输出图像以增强视觉质量与指令对齐;2)有选择地重写提示词以提升语义清晰度。为验证我们数据集的有效性,我们在 GPT-IMAGE-EDIT-1.5M 上对先进开源模型进行了微调。实证结果令人振奋,例如,微调后的 FluxKontext 在全面的基准测试套件中取得了极具竞争力的性能,包括在 GEdit-EN 上 7.24 分、在 ImgEdit-Full 上 3.80 分以及在 Complex-Edit 上 8.78 分,展现出更强的指令遵循能力、更高的感知质量并保持了身份一致性。这些分数显著超越了所有此前发表的开源方法,并大幅缩小了与领先专有模型的差距。我们希望 GPT-IMAGE-EDIT-1.5M 的全面发布能助力推动指令引导图像编辑领域的进一步开放研究。

关键词

引用

@article{arxiv.2507.21033,
  title  = {GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset},
  author = {Yuhan Wang and Siwei Yang and Bingchen Zhao and Letian Zhang and Qing Liu and Yuyin Zhou and Cihang Xie},
  journal= {arXiv preprint arXiv:2507.21033},
  year   = {2025}
}