支配者与被支配者:扩散模型中的生成性崩溃
机器学习
2025-12-25 v1 人工智能
摘要
文本到图像扩散模型因能够生成多样且高保真图像而受到广泛关注。然而,在生成来自多概念提示时,往往有一个概念 token 主导生成,压制其他概念——我们将这种现象称为支配者与被支配者 (Dominant-vs-Dominated, DvD) 不平衡。为系统性地分析这种不平衡,我们引入了 DominanceBench 并从数据和架构两个角度检视其根源。通过各种实验,我们表明训练数据中实例的有限多样性加剧了概念之间的相互干扰。对跨注意力动力学的分析进一步揭示,支配 token 在扩散时间步中迅速饱和注意力,逐步压制其他 token。此外,head ablation 研究表明,DvD 行为源于跨多个注意力头的分布式注意力机制。我们的发现为理解生成性崩溃提供了关键见解,推动了更可靠、更可控的文本到图像生成。
引用
@article{arxiv.2512.20666,
title = {Dominating vs. Dominated: Generative Collapse in Diffusion Models},
author = {Hayeon Jeong and Jong-Seok Lee},
journal= {arXiv preprint arXiv:2512.20666},
year = {2025}
}