ConceptPrune:通过技能神经元剪枝实现扩散模型中的概念编辑
计算机视觉与模式识别
2024-05-30 v1 人工智能
机器学习
摘要
尽管大规模文本到图像扩散模型已展示出惊人的图像生成能力,但仍存在滥用生成不安全内容、侵犯版权和延续社会偏见的顾虑。最近,文本到图像生成社区开始通过编辑或忘却预训练模型中不希望出现的概念来解决这些问题。然而,这些方法常常涉及数据密集且效率低下的微调,或利用各种形式的 token 重映射,使其易受对抗性越狱攻击。本文提出一种简单有效的训练-free 方法,即 ConceptPrune,通过首先识别预训练模型中负责生成不希望概念的关键区域,从而通过权重剪枝实现对概念的直接忘却。实验在包括艺术风格、裸露、对象擦除和性别去偏见等多种概念上表明,目标概念可通过剪枝约占总权重 0.12% 的极小比例进行高效擦除,实现对多个概念的擦除,并对各种白盒和黑盒对抗攻击具有鲁棒性。
引用
@article{arxiv.2405.19237,
title = {ConceptPrune: Concept Editing in Diffusion Models via Skilled Neuron Pruning},
author = {Ruchika Chavhan and Da Li and Timothy Hospedales},
journal= {arXiv preprint arXiv:2405.19237},
year = {2024}
}