深度梦幻:可视化扩散模型中单义性特征
机器学习
2026-05-12 v1 计算机视觉与模式识别
摘要
本文提出了一种称为潜在优化可视化(LVO)的机制性可解释性技术,将最初用于卷积神经网络的特征可视化 by optimization 方法扩展到潜在扩散模型。LVO采用稀疏自编码器(SAEs)将多义性图层表示分解为单义性特征。我们的关键贡献包括潜在空间优化、时间步活动分析、与调度匹配的噪声注入、通过特征驾驶实现的先验初始化以及合适的正则化策略。我们在Stable Diffusion 1.5模型上进行验证,后者在Style50数据集上进行微调,结果表明SAE特征能够产生清晰可识别的概念可视化,包括对角线构图、人物、玫瑰、电缆和瀑布泡沫等,这些特征与数据集中的示例相吻合,而无需 disentanglement 的基线则产生结果较不连贯。我们进一步表明,来自像素空间特征可视化的正则化技术可迁移到潜在域,但需要为原始图层和SAE变体配置不同的参数。与数据集示例和驾驶相比,LVO提供了补充性的见解,直接揭示了什么会激活某个特征,而非其下游效应。
引用
@article{arxiv.2605.08218,
title = {Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models},
author = {Adam Szokalski and Mateusz Modrzejewski},
journal= {arXiv preprint arXiv:2605.08218},
year = {2026}
}