Qwen-Image-2.0 技术报告
计算机视觉与模式识别
2026-05-12 v1
摘要
我们介绍 Qwen-Image-2.0,这是一个统一高保真生成和精确图像编辑的全能图像生成基础模型。尽管近期进展取得显著成果,但现有模型仍在超长文本渲染、多语言排版、高分辨率照片写实、鲁棒的指令遵循以及高效部署方面受限,尤其是在文本丰富且结构复杂的场景中。Qwen-Image-2.0 通过将 Qwen3-VL 作为条件编码器与多模态扩散变换器耦合,实现联合条件-目标建模,同时进行大规模数据策划和定制化的多阶段训练管道。这一设计在保持灵活的生成和编辑能力的同时,提供了强大的多模态理解能力。该模型支持最高达 1K token 的指令,用于生成文本丰富的内容,如幻灯片、海报、信息图表和漫画,显著提升了多语言文本保真度和排版质量。它还增强了照片写实生成,使其细节更丰富、纹理更真实、光照更连贯,并且在多样化的风格下更可靠地遵循复杂指令。广泛的人类评估表明,Qwen-Image-2.0 在生成和编辑方面均显著优于之前的 Qwen-Image 模型,标志着通用、可靠且实用的图像生成基础模型迈出了重要一步。
引用
@article{arxiv.2605.10730,
title = {Qwen-Image-2.0 Technical Report},
author = {Bing Zhao and Chenfei Wu and Deqing Li and Hao Meng and Jiahao Li and Jie Zhang and Jingren Zhou and Junyang Lin and Kaiyuan Gao and Kuan Cao and Kun Yan and Liang Peng and Lihan Jiang and Niantong Li and Ningyuan Tang and Shengming Yin and Tianhe Wu and Xiao Xu and Xiaoyue Chen and Xihua Wang and Yan Shu and Yanran Zhang and Yi Wang and Yilei Chen and Ying Ba and Yixian Xu and Yujia Wu and Yuxiang Chen and Zecheng Tang and Zekai Zhang and Zhendong Wang and Zihao Liu and Zikai Zhou and An Yang and Chen Cheng and Chenxu Lv and Dayiheng Liu and Fan Zhou and Hantian Xiong and Hongzhu Shi and Hu Wei and Huihong Zhao and Ivy Liu and Jianwei Zhang and Jiawei Zhang and Kai Chen and Kang He and Levon Xue and Lin Qu and Linhan Tang and Luwen Feng and Minggang Wu and Minmin Sun and Na Ni and Rui Men and Shuai Bai and Sishou Zheng and Tao Lan and Tianqi Zhang and Tingkun Wen and Wei Wang and Weixu Qiao and Weiyi Lu and Wenmeng Zhou and Xiaodong Deng and Xiaoxiao Xu and Xinlei Fang and Xionghui Chen and Yanan Wang and Yang Fan and Yichang Zhang and Yixuan Xu and Yu Wu and Zhiyuan Ma and Zhizhi Cai},
journal= {arXiv preprint arXiv:2605.10730},
year = {2026}
}