中文

HiDream-I1:基于稀疏Diffusion Transformer的高效图像生成基础模型

计算机视觉与模式识别 2025-05-30 v1 多媒体

摘要

图像生成基础模型的最新进展优先考虑质量提升,但通常以增加计算复杂度和推理延迟为代价。为了解决这一关键权衡,我们引入了HiDream-I1,这是一个具有17B参数的新开源图像生成基础模型,可在几秒钟内实现SOTA图像生成质量。HiDream-I1由新的稀疏Diffusion Transformer(DiT)结构构建。具体而言,它从具有动态混合专家架构的双流解耦稀疏DiT设计开始,其中首先涉及两个独立的编码器分别处理图像和文本token。然后,采用具有动态MoE架构的单流稀疏DiT结构,以成本高效的方式触发图像生成的多模态交互。为了支持不同模型能力的灵活访问,我们提供了三种HiDream-I1变体:HiDream-I1-Full、HiDream-I1-Dev和HiDream-I1-Fast。此外,我们超越了典型的文本到图像生成,利用额外的图像条件重塑HiDream-I1,对给定图像执行精确的、基于指令的编辑,产生了一个新的基于指令的图像编辑模型,即HiDream-E1。最终,通过整合文本到图像生成和基于指令的图像编辑,HiDream-I1演进形成了一个能够完全交互式图像创建和细化的综合图像代理。为了加速多模态AIGC研究,我们通过项目网站开源了HiDream-I1-Full、HiDream-I1-Dev、HiDream-I1-Fast、HiDream-E1的所有代码和模型权重:https://github.com/HiDream-ai/HiDream-I1 和 https://github.com/HiDream-ai/HiDream-E1。所有功能均可通过 https://vivago.ai/studio 直接体验。

关键词

引用

@article{arxiv.2505.22705,
  title  = {HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer},
  author = {Qi Cai and Jingwen Chen and Yang Chen and Yehao Li and Fuchen Long and Yingwei Pan and Zhaofan Qiu and Yiheng Zhang and Fengbin Gao and Peihan Xu and Yimeng Wang and Kai Yu and Wenxuan Chen and Ziwei Feng and Zijian Gong and Jianzhuang Pan and Yi Peng and Rui Tian and Siyu Wang and Bo Zhao and Ting Yao and Tao Mei},
  journal= {arXiv preprint arXiv:2505.22705},
  year   = {2025}
}

备注

Source codes and models are available at https://github.com/HiDream-ai/HiDream-I1 and https://github.com/HiDream-ai/HiDream-E1