中文

ShareGPT-4o-Image:将多模态模型对齐GPT-4o级图像生成

计算机视觉与模式识别 2025-06-24 v1 人工智能 机器学习

摘要

最近的多模态生成模型进展已实现了超现实主义、指令对齐的图像生成,但领先系统如GPT-4o-Image仍属专有且不可获取。为实现这些能力的民主化,我们提出ShareGPT-4o-Image,这是首个包含45K文本到图像和46K文本与图像到图像数据的数据集,所有数据均使用GPT-4o的图像生成能力进行合成,以提炼其先进的图像生成能力。借助该数据集,我们开发了Janus-4o,这是一个能够进行文本到图像和文本与图像到图像生成的多模态大语言模型。Janus-4o不仅在其前身Janus-Pro基础上显著提升文本到图像生成效果,还全新支持文本与图像到图像生成。值得注意的是,它仅需91K合成样本和8张A800 GPU机器6小时的训练,即可在从零开始实现惊人的文本与图像到图像生成性能。我们希望ShareGPT-4o-Image和Janus-4o的发布能促进超现实主义、指令对齐图像生成的开放研究。

关键词

引用

@article{arxiv.2506.18095,
  title  = {ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation},
  author = {Junying Chen and Zhenyang Cai and Pengcheng Chen and Shunian Chen and Ke Ji and Xidong Wang and Yunjin Yang and Benyou Wang},
  journal= {arXiv preprint arXiv:2506.18095},
  year   = {2025}
}