中文

FireRed-Image-Edit 1.0 技术报告

计算机视觉与模式识别 2026-02-23 v1 图像与视频处理

摘要

我们介绍 FireRed-Image-Edit,这是一款基于扩散转换器的指令式图像编辑模型,通过系统性地优化数据策划、训练方法和评估设计实现了最先进的性能。我们构建了一个由 16 亿样本组成的训练语料库,其中包含 9 亿文本到图像和 7 亿图像编辑配对,来自多样化的不同来源。经过严格的清洗、分层、自动标注和两阶段筛选后,我们保留了超过 1 亿高质量样本,生成与编辑数据保持平衡,确保了强大的语义覆盖和指令对齐。我们的多阶段训练管道通过预训练、监督微调和强化学习逐步构建编辑能力。为提高数据效率,我们引入了面向可变分辨率批处理的多条件感知 Bucket Sampler,以及基于动态提示重新索引的随机指令对齐技术。为稳定优化并增强可控性,我们提出了用于 DPO 的非对称梯度优化、面向文本编辑的布局感知 OCR 奖励的 DiffusionNFT,以及用于身份保持的可微一致性损失。我们进一步建立了 REDEdit-Bench,这是一个涵盖 15 种编辑类别的综合性基准,包括新引入的美化和低层次增强任务。在 REDEdit-Bench 和公开基准(ImgEdit 和 GEdit)上的大量实验表明,我们的系统在性能上与众多开源和专有系统相比具有竞争力或更优的表现。我们发布代码、模型以及基准套件,以支持未来的研究。

关键词

引用

@article{arxiv.2602.13344,
  title  = {FireRed-Image-Edit-1.0 Technical Report},
  author = {Super Intelligence Team and Changhao Qiao and Chao Hui and Chen Li and Cunzheng Wang and Dejia Song and Jiale Zhang and Jing Li and Qiang Xiang and Runqi Wang and Shuang Sun and Wei Zhu and Xu Tang and Yao Hu and Yibo Chen and Yuhao Huang and Yuxuan Duan and Zhiyi Chen and Ziyuan Guo},
  journal= {arXiv preprint arXiv:2602.13344},
  year   = {2026}
}