中文

Nucleus-Image: 用于图像生成的稀疏混合专家模型

计算机视觉与模式识别 2026-04-15 v1

摘要

我们提出了Nucleus-Image,一个文本到图像生成模型,它在GenEval、DPG-Bench和OneIG-Bench上达到或超越了领先模型,同时每次前向传播仅激活约20亿参数,建立了质量与效率之间的新帕累托前沿。Nucleus-Image采用了一种带有专家选择路由的稀疏混合专家扩散Transformer架构,将总模型容量扩展到每层64个路由专家的170亿参数。我们采用了一种针对推理效率优化的精简架构,完全将文本令牌排除在Transformer主干之外,并使用联合注意力机制,使得文本键值可以在不同时间步之间共享。为了在使用时间步调制时提高路由稳定性,我们引入了一种解耦路由设计,将时间步感知的专家分配与时间步条件的专家计算分开。我们通过多阶段过滤、去重、美学分级和标题策划,构建了一个包含15亿高质量训练对、涵盖7亿张独特图像的大规模训练语料库。训练遵循渐进式分辨率课程(256到512到1024),并在每个阶段采用多宽高比分桶,同时结合专家容量因子的渐进式稀疏化。我们采用了Muon优化器,并分享了为带有时间步调制的扩散模型量身定制的参数分组方案。Nucleus-Image证明了稀疏混合专家扩展是实现高质量图像生成的一条非常有效的途径,以推理成本的一小部分达到了具有显著更大活跃参数预算的模型的性能。这些成果是在没有任何后训练优化的情况下实现的:没有强化学习,没有直接偏好优化,也没有人类偏好调整。我们发布了训练方案,使Nucleus-Image成为首个达到此质量的完全开源混合专家扩散模型。

关键词

引用

@article{arxiv.2604.12163,
  title  = {Nucleus-Image: Sparse MoE for Image Generation},
  author = {Chandan Akiti and Ajay Modukuri and Murali Nandan Nagarapu and Gunavardhan Akiti and Haozhe Liu},
  journal= {arXiv preprint arXiv:2604.12163},
  year   = {2026}
}