中文

Muddit: 利用统一离散扩散模型解放文本到图像之外的生成

机器学习 2026-05-27 v5 计算机视觉与模式识别

摘要

统一生成模型旨在通过单一架构和解码范式处理跨模态的多种任务——例如文本生成、图像生成和视觉语言推理。自回归统一模型由于顺序解码导致推理缓慢,而非自回归统一模型由于预训练骨干网络有限导致泛化能力较弱。我们引入了第二代 Meissonic:Muddit,这是一种统一的离散扩散 Transformer,能够在文本和图像两种模态上实现快速且并行的生成。与以往从头开始训练的统一扩散模型不同,Muddit 将来自预训练文本到图像骨干网络的强视觉先验与轻量级文本解码器相集成,在统一架构下实现了灵活且高质量的多模态生成。实证结果表明,与规模显著更大的自回归模型相比,Muddit 在质量和效率上均取得了具有竞争力或更优的性能。这项工作突显了纯离散扩散在配备强视觉先验时,作为统一生成可扩展且有效骨干网络的潜力。

关键词

引用

@article{arxiv.2505.23606,
  title  = {Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model},
  author = {Qingyu Shi and Jinbin Bai and Zhuoran Zhao and Wenhao Chai and Kaidong Yu and Jianzong Wu and Yunhai Tong and Xiangtai Li and Xuelong Li and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2505.23606},
  year   = {2026}
}

备注

Accepted to ICLR 2026. Codes and Supplementary Material: https://github.com/M-E-AGI-Lab/Muddit