Qwen-Image 技术报告
计算机视觉与模式识别
2025-08-05 v1
摘要
我们介绍Qwen-Image,这是Qwen系列中的一种图像生成基础模型,在复杂文本渲染和精确图像编辑方面取得了显著进展。为解决复杂文本渲染挑战,我们设计了包括大规模数据收集、筛选、标注、合成和平衡在内的综合数据管道。此外,我们采用渐进式训练策略,从非文本到文本渲染开始,先从简单文本输入演化到复杂文本输入,逐步扩展到段落级别描述。这种课程学习方法显著增强了模型的原生文本渲染能力。因此,Qwen-Image不仅在如英语等拉丁文字语言方面表现卓越,也在对更具挑战性的表意文字语言(如中文)方面取得了显著进展。为增强图像编辑一致性,我们引入改进的多任务训练范式,纳入不仅是传统文本到图像(T2I)和文本图像到图像(TI2I)任务,还包括图像到图像(I2I)重建,从而有效对齐Qwen2.5-VL与MMDiT之间的潜在表示。此外,我们分别将原始图像输入到Qwen2.5-VL和VAE编码器,以获得语义和重建表示。这种双编码机制使编辑模块能够在保持语义一致性和维持视觉保真度之间取得平衡。Qwen-Image在多个基准测试中实现了最先进的性能,展示了其在图像生成和编辑方面的强大能力。
引用
@article{arxiv.2508.02324,
title = {Qwen-Image Technical Report},
author = {Chenfei Wu and Jiahao Li and Jingren Zhou and Junyang Lin and Kaiyuan Gao and Kun Yan and Sheng-ming Yin and Shuai Bai and Xiao Xu and Yilei Chen and Yuxiang Chen and Zecheng Tang and Zekai Zhang and Zhengyi Wang and An Yang and Bowen Yu and Chen Cheng and Dayiheng Liu and Deqing Li and Hang Zhang and Hao Meng and Hu Wei and Jingyuan Ni and Kai Chen and Kuan Cao and Liang Peng and Lin Qu and Minggang Wu and Peng Wang and Shuting Yu and Tingkun Wen and Wensen Feng and Xiaoxiao Xu and Yi Wang and Yichang Zhang and Yongqiang Zhu and Yujia Wu and Yuxuan Cai and Zenan Liu},
journal= {arXiv preprint arXiv:2508.02324},
year = {2025}
}
备注
https://github.com/QwenLM/Qwen-Image