中文

Step1X-Edit:通用图像编辑的实用框架

计算机视觉与模式识别 2025-08-01 v5

摘要

近年来,图像编辑模型取得了显著且快速的进展。近期推出的多模态模型如 GPT-4o 与 Gemini2 Flash 带来了极具前景的图像编辑能力,展现出惊人的能力,能够满足用户广泛的编辑需求,为图像操作领域带来了重大突破。然而,这些封闭式模型与开源算法之间仍存较大差距。为此,本文发布一种名为 Step1X-Edit 的最新图像编辑模型,旨在提供与 GPT-4o 与 Gemini2 Flash 等封闭式模型相当的性能。具体而言,我们采用多模态大语言模型处理参考图像与用户编辑指令,提取潜在嵌入向量并通过扩散图像解码器获得目标图像。为训练该模型,我们构建了数据生成管道,以产出高质量数据集。为评估效果,我们开发了 GEdit-Bench—a 基于真实用户指令的新型基准测试。GEdit-Bench 上的实验结果表明,Step1X-Edit 在已有开源基准中以显著优势运行,并逼近主流专有模型的性能,为图像编辑领域作出了重要贡献。

关键词

引用

@article{arxiv.2504.17761,
  title  = {Step1X-Edit: A Practical Framework for General Image Editing},
  author = {Shiyu Liu and Yucheng Han and Peng Xing and Fukun Yin and Rui Wang and Wei Cheng and Jiaqi Liao and Yingming Wang and Honghao Fu and Chunrui Han and Guopeng Li and Yuang Peng and Quan Sun and Jingwei Wu and Yan Cai and Zheng Ge and Ranchen Ming and Lei Xia and Xianfang Zeng and Yibo Zhu and Binxing Jiao and Xiangyu Zhang and Gang Yu and Daxin Jiang},
  journal= {arXiv preprint arXiv:2504.17761},
  year   = {2025}
}

备注

code: https://github.com/stepfun-ai/Step1X-Edit