中文

解构 MMDiT 块:训练无监督的文本条件扩散模型分析与提升

计算机视觉与模式识别 2026-01-06 v1

摘要

最近的基于转换器的扩散模型突破,尤其是以多模态扩散转换器(MMDiT)驱动的模型,如 FLUX 和 Qwen Image,为文本到图像生成和编辑带来了激动人心的体验。为了理解 MMDiT 模型的内部机制,现有方法尝试分析特定组件(如位置编码和注意力层)的作用。然而,如何不同块及其与文本条件的相互作用贡献于合成过程仍然是模糊的。在本文中,我们首先构建一个系统化的管道,全面考察每个块的功能,通过移除、禁用和增强相应块上的文本隐藏状态。我们的分析揭示了:1)语义信息出现在早期块,更细节在后期块中呈现;2)移除特定块通常比禁用文本条件更不具破坏性;3)在选择性块上增强文本条件可提升语义属性。基于这些观察,我们进一步提出了一系列创新的训练无监督策略,以实现更好的文本对齐、精确编辑和加速。广泛的实验表明,我们的方法在各种基线上均优于现有方法,且在文本到图像生成、图像编辑和推理加速方面具有良好的灵活性。我们的 method 将 SD3.5 上的 T2I-Combench++ 从 56.92% 提升至 63.00%,将 GenEval 从 66.42% 提升至 71.63%,且不牺牲合成质量。这些结果推动了对 MMDiT 模型的理解,并为进一步改进提供了宝贵的见解。

关键词

引用

@article{arxiv.2601.02211,
  title  = {Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion},
  author = {Binglei Li and Mengping Yang and Zhiyu Tan and Junping Zhang and Hao Li},
  journal= {arXiv preprint arXiv:2601.02211},
  year   = {2026}
}

备注

11 pages