Z-Image:基于单流扩散Transformer的高效图像生成基础模型
计算机视觉与模式识别
2025-12-09 v3
摘要
高性能图像生成模型的当前领域由专有系统主导,如 Nano Banana Pro 和 Seedream 4.0。领先的开源替代方案,包括 Qwen-Image、Hunyuan-Image-3.0 和 FLUX.2,都具有大量参数 (20B 到 80B),因此在推理和基于消费级硬件上的微调上难以实用。为弥合这一差距,我们提出 Z-Image,一个基于可扩展单流扩散Transformer (S3-DiT) 架构构建的高效 6B 参数基础生成模型,挑战了“一切都追求规模”的范式。通过系统性地优化整个模型生命周期——从精选的数据基础设施到简化的训练课程——我们在仅 314K 个 H800 GPU 小时 (约 63 万美元) 内完成了完整的训练工作流程。我们的少步蒸馏方案配合奖励后训练进一步获得 Z-Image-Turbo,实现在企业级 H800 GPU 上实现亚秒级推理延迟,并兼容消费级硬件 (<16GB VRAM)。此外,我们的全能预训练范式也使 Z-Image-Edit 能够高效训练,该模型展现出惊人的指令跟随能力。定性和定量实验表明,我们的模型在 various dimensions 上实现与或超越领先竞争者的性能。最突出的是,Z-Image 在逼真图像生成和双语文本渲染方面展现出卓越能力,交付的结果与顶级商业模型相媲美,从而表明以显著降低的计算开销即可实现最先进的结果。我们公开发布代码、模型权重和在线演示,以培育可访问、具有性价比且具最先进生成模型的开发。
关键词
引用
@article{arxiv.2511.22699,
title = {Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer},
author = {Image Team and Huanqia Cai and Sihan Cao and Ruoyi Du and Peng Gao and Steven Hoi and Zhaohui Hou and Shijie Huang and Dengyang Jiang and Xin Jin and Liangchen Li and Zhen Li and Zhong-Yu Li and David Liu and Dongyang Liu and Junhan Shi and Qilong Wu and Feng Yu and Chi Zhang and Shifeng Zhang and Shilin Zhou},
journal= {arXiv preprint arXiv:2511.22699},
year = {2025}
}