中文

$\textit{Revelio}$:解读和利用扩散模型中的语义信息

计算机视觉与模式识别 2025-08-05 v3

摘要

我们研究如何\textit{如何}在不同扩散模型架构的不同层和去噪时间步骤中表示丰富的视觉语义信息。我们通过利用 k-稀疏自编码器(k-SAE)发现单义可解释特征。我们通过在离线获取的扩散模型特征上使用轻量级分类器进行 transfer learning 来验证我们的机制解释。我们在 4 个数据集上展示了扩散特征用于表征学习的有效性。我们对不同扩散模型架构、预训练数据集和语言模型条件对视觉表征细粒度、归纳偏置和 transfer learning 能力的影响进行了深入分析。我们的工作是深化黑箱扩散模型可解释性的关键一步。代码和可视化已公开于:https://github.com/revelio-diffusion/revelio

关键词

引用

@article{arxiv.2411.16725,
  title  = {$\textit{Revelio}$: Interpreting and leveraging semantic information in diffusion models},
  author = {Dahye Kim and Xavier Thomas and Deepti Ghadiyaram},
  journal= {arXiv preprint arXiv:2411.16725},
  year   = {2025}
}

备注

ICCV 2025