中文

揭示扩散模型中的概念归因

计算机视觉与模式识别 2025-10-29 v3 机器学习

摘要

扩散模型在从文本提示生成逼真且高质量的图像方面表现出色。然而,训练好的模型仍然是黑箱,关于其组件在展现概念(如对象或风格)方面作用的了解寥寥。最近的工作采用因果追踪来局部化生成模型中存储知识的层,但未显示其他层如何为目标概念做出贡献。本工作从更一般的角度来处理扩散模型的可解释性问题,提出问题:"各个模型组件如何共同工作来展示知识?"。为了回答这个问题,我们使用组件归因来分解扩散模型,系统性地揭示每个组件(具体为模型参数)在生成概念中的重要性。提出的框架称为组件归因扩散模型(CAD),发现导致概念诱导(正向)组件的局部化,意外地揭示了另一种对生成概念有负面贡献的组件,这在先前的知识局部化工作中缺失。基于对扩散模型的全面理解,我们引入两个快速的推理时模型编辑算法,CAD-Erase和CAD-Amplify;特别是,CAD-Erase允许通过削减正向组件来擦除概念,CAD-Amplify允许通过放大负向组件来放大生成的概念,同时保留其他概念的知识。大量实验结果验证了我们框架所确定的正向和负向组件的重要性,展示了为解释生成模型提供完整视图的潜力。我们的代码可在此处获取。

关键词

引用

@article{arxiv.2412.02542,
  title  = {Unveiling Concept Attribution in Diffusion Models},
  author = {Quang H. Nguyen and Hoang Phan and Khoa D. Doan},
  journal= {arXiv preprint arXiv:2412.02542},
  year   = {2025}
}