中文

用于解释扩散模型的残差化时间稀疏自编码器

计算机视觉与模式识别 2026-05-28 v1 人工智能 机器学习

摘要

文本到图像扩散模型通过迭代去噪过程生成图像,因此内部神经层产生激活轨迹而非单一的静态表示。稀疏自编码器(SAE)最近被用于将扩散激活分解为可解释的特征方向,但大多数方法分析单个时间步的激活或基于时间条件,而非直接从完整的激活轨迹中学习。在这项工作中,我们引入了用于扩散激活轨迹的残差化时间SAE。我们收集去噪时间内的激活,拟合相邻时间步之间的线性预测器,并使用初始激活以及这些线性动力学无法解释的残差分量来表示每个轨迹。在这种残差化表示上训练SAE,鼓励稀疏潜变量捕捉超出线性可预测范围的结构。残差化解码器方向可以映射回激活空间,使得每个潜变量可以作为去噪时间上的特征轨迹进行分析。通过在Stable Diffusion 1.5上的重建与消融研究、时空特征分析和定性引导实验,我们表明残差化时间SAE为研究时间结构化的扩散激活提供了一个有用的框架。

关键词

引用

@article{arxiv.2605.27813,
  title  = {Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models},
  author = {Calvin Yeung and Prathyush Poduval and Ali Zakeri and Zhuowen Zou and Mohsen Imani},
  journal= {arXiv preprint arXiv:2605.27813},
  year   = {2026}
}