中文

ERNIE-Image 技术报告

计算机视觉与模式识别 2026-05-26 v1 机器学习

摘要

我们介绍了 ERNIE-Image,这是一个基于 8B 单流 DiT 架构构建的开源文本到图像生成模型。ERNIE-Image 旨在通过更有效地挖掘大规模预训练数据和改进训练期间的监督质量,弥合当前开源模型与领先封闭源系统之间的差距。在预训练期间,我们采用自下而上的数据构建管道,结合细粒度图像分类、丰富的标题注释、审美评估和层次化抽样。这一策略减少了数据噪声,同时保留长尾概念和详细的真实世界知识,为复杂生成任务提供了更强大的基础。在 post-training 阶段,我们使用自上而下的数据构建管道处理高需求场景,多样化提示注释以更好地匹配真实用户输入,并应用稳定的 DPO 策略以与人类审美偏好对齐。我们进一步训练 ERNIE-Image-Turbo 以实现高效的 8-NFE 生成,并提出 MT-DMD 以缓解蒸馏期间的能力漂移。为便于在实际场景中使用,我们为其配备了一个轻量级 Prompt Enhancer,将简洁的用户意图扩展为结构化的视觉描述。此外,我们开发了 ERNIE-Image-Aes,一个工业级的审美模型,以及 ERNIE-Image-Aes-1K,一个用于真实审美评估的人工标注基准数据集。广泛的定性和定量实验表明,ERNIE-Image 在开源模型中实现了领先的性能,并在指令遵循、文本渲染和审美质量方面接近顶级商业模型。我们发布了训练好的模型和审美资源,以促进 AIGC 社区的进一步学术研究和技术进步。

关键词

引用

@article{arxiv.2605.25347,
  title  = {ERNIE-Image Technical Report},
  author = {Jiaxiang Liu and Zhida Feng and Pengyu Zou and Zhenyu Qian and Tianrui Zhu and Jun Xia and Yuehu Dong and Yanzheng Lin and Honglin Xiong and Anqi Chen and Yunpeng Ding and Jinghui Duan and Lin Gao and Chao Han and Tiechao He and Jiakang Hu and Ranjun Hua and Xueming Jiang and Qingli Kong and Yuting Lei and Tianyu Li and Yunlin Liu and Changling Liu and Yaxin Liu and Yi Liu and Xuguang Liu and Xiaolong Ma and Yan Pan and Yiran Ren and Nan Sheng and Yu Sun and Siyang Sun and Yixiang Tu and Yang Wan and Huanai Wang and Siqi Wang and Yang Wu and Youzhi Yang and Xiaowen Yang and Jianwen Yang and Yehua Yang and Quanwen Zhang and Xinmin Zhang and Haoxin Zhang and Xiang Zhang and Jun Zhang and Qian Zhang and Qiao Zhao and Qi Zhou},
  journal= {arXiv preprint arXiv:2605.25347},
  year   = {2026}
}