扩散模型中可解释概念的出现与演化
计算机视觉与模式识别
2026-01-23 v2 机器学习
图像与视频处理
摘要
扩散模型已成为文本到图像生成的首选方法,能够从纯噪声生成高质量图像。然而,由于其黑箱特性和复杂的多步骤生成过程,扩散模型的内部工作原理仍然鲜为人知。机械可解释性技术,如稀疏自编码器(Sparse Autoencoders, SAEs),在理解和引导大规模语言模型行为方面取得了显著成果。然而,SAE的巨大潜力尚未应用于深入理解扩散模型复杂生成过程。本文我们利用SAE框架探讨流行文本到图像扩散模型的内部机制,发现其中包含多种人类可解释概念。有趣的是,我们发现即使在完成第一步反向扩散之前,仅通过观察激活概念的空间分布,就能相当准确地预测最终场景的构成。更进一步,我们设计了针对图像构成和风格操控的干预技术,证明:(1)在扩散的早期阶段,图像构成可以有效控制;(2)在中期阶段,图像构成已基本确定,但风格干预仍然有效;(3)在最终阶段,仅能对细微的纹理细节进行修改。
引用
@article{arxiv.2504.15473,
title = {Emergence and Evolution of Interpretable Concepts in Diffusion Models},
author = {Berk Tinaz and Zalan Fabian and Mahdi Soltanolkotabi},
journal= {arXiv preprint arXiv:2504.15473},
year = {2026}
}
备注
32 pages, 32 figures, published at the 39th Conference on Neural Information Processing Systems (NeurIPS), 2025