中文

DreamReader:面向文本到图像模型的解释性工具包

机器学习 2026-03-17 v1 人工智能

摘要

尽管文本到图像(T2I)扩散模型在快速采纳中取得了显著进展,但因果和表征层面的分析仍呈碎片化,主要局限于孤立的探针技术。为此,我们引入DreamReader:一个统一的框架,将扩散模型解释性形式化为跨模块和跨时间步的可组合表征算子,包括激活提取、因果拼接、结构化剔除和激活引导。DreamReader提供一种模型无关的抽象层,使扩散模型体系结构能够进行系统化分析和干预。除整合现有方法外,DreamReader还引入了扩散模型的三个新颖干预原语:(1)基于子空间约束的表示微调(LoReFT)用于内部适应;(2)使用在激活上训练的MLP探针进行的分类器引导梯度引导;(3)用于系统性研究跨模态表示可迁移性的组件级跨模型映射。这些机制允许我们通过借鉴LLM解释性技术,对T2I模型进行轻量级白盒干预。我们通过受控实验演示DreamReader:(i)在两个模型之间进行激活拼接,(ii)应用LoReFT来引导多个激活单元,可靠地将目标概念注入生成图像中。实验以声明方式指定并在受控的批量管道中执行,以实现可重复的大规模分析。通过多个案例研究,我们展示了从语言模型解释性技术中移植的技术在扩散模型中显示出有前景且可控的干预效果。DreamReader作为开源工具包已发布,旨在推动T2I解释性研究的发展。

关键词

引用

@article{arxiv.2603.13299,
  title  = {DreamReader: An Interpretability Toolkit for Text-to-Image Models},
  author = {Nirmalendu Prakash and Narmeen Oozeer and Michael Lan and Luka Samkharadze and Phillip Howard and Roy Ka-Wei Lee and Dhruv Nathawani and Shivam Raval and Amirali Abdullah},
  journal= {arXiv preprint arXiv:2603.13299},
  year   = {2026}
}