SAeUron:基于稀疏自编码器的可解释概念忘卸
机器学习
2025-05-23 v3 人工智能
摘要
扩散模型虽然强大,但可能无意中生成有害或不希望的内容,引发重大的伦理和安全问题。最近的机器忘卸方法提供了潜在解决方案,但往往缺乏透明度,难以理解其对基础模型所引入的更改。本文介绍了 SAeUron,一种新方法,利用稀疏自编码器(SAE)学习的特征来消除文本到图像扩散模型中的不希望概念。首先,我们展示了 SAE 在对扩散模型多个去噪时间步的激活进行无监督训练后,捕获与特定概念对应的稀疏且可解释的特征。基于此,我们提出了一种特征选择方法,使可针对模型激活进行精确干预,以阻止目标内容同时保持整体性能。我们的评估显示,SAeUron 在 UnlearnCanvas 数据集上优于现有方法,有效消除裸露内容。此外,我们表明仅用一个 SAE 即可同时消除多个概念,并且与其他方法相比,SAeUron 能减缓在对抗性攻击下的生成不希望内容的可能性。代码和模型 checkpoint 可在 https://github.com/cywinski/SAeUron 获取。
引用
@article{arxiv.2501.18052,
title = {SAeUron: Interpretable Concept Unlearning in Diffusion Models with Sparse Autoencoders},
author = {Bartosz Cywiński and Kamil Deja},
journal= {arXiv preprint arXiv:2501.18052},
year = {2025}
}