HiDream-O1-Image:原生统一图像生成基础模型,基于像素级统一 Transformer
摘要
视觉生成模型的演进长期受限于依赖分离文本编码器和外部 VAE 的碎片化架构。本报告中,我们提出 HiDream-O1-Image,这是一种通过像素空间扩散 Transformer 实现的原生统一生成基础模型,开创了从模块化架构向端到端情境视觉生成引擎的范式转变。通过将原始图像像素、文本标记和任务特定条件映射到单个共享标记空间,HiDream-O1-Image 在统一 Transformer(UiT)架构中实现了多模态输入的结构统一。这种原生编码范式消除了对独立 VAE 或分离预训练文本编码器的需求,使模型能够将多样化的生成和编辑任务视为一致的情境推理过程。广泛的实验表明,HiDream-O1-Image 在包括文本到图像生成、基于指令的编辑和主体驱动的个性化等多种生成任务中表现出色。值得注意的是,仅凭 8B 参数,HiDream-O1-Image(8B)即可实现与甚至超越采用显著更多参数(例如 27B Qwen-Image)的 established state-of-the-art 模型持平或更好的性能。关键在于,为验证这一范式的巨大可扩展性,我们成功地将架构扩展至超过 200B 参数。实验结果表明,巨大规模版本 HiDream-O1-Image-Pro(200B+)解锁了前所未有的生成能力和卓越性能,建立了新的 state-of-the-art 基准。最终,HiDream-O1-Image 凸显了原生统一架构的巨大潜力,并为下一代多模态 AI 绘绘了高度可扩展的道路。
引用
@article{arxiv.2605.11061,
title = {HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer},
author = {Qi Cai and Jingwen Chen and Chengmin Gao and Zijian Gong and Yehao Li and Yingwei Pan and Yi Peng and Zhaofan Qiu and Kai Yu and Yiheng Zhang and Hao Ai and Siying Bai and Yang Chen and Zhihui Chen and Fengbin Gao and Ying Guo and Dong Li and Zhen Shen and Leilei Shi and Jing Wang and Siyu Wang and Yimeng Wang and Rui Zheng and Ting Yao and Tao Mei},
journal= {arXiv preprint arXiv:2605.11061},
year = {2026}
}
备注
Source codes and models are available at Github: https://github.com/HiDream-ai/HiDream-O1-Image and Huggingface: https://huggingface.co/HiDream-ai/HiDream-O1-Image