重新思考概念擦除的脆弱性与一种新方法
机器学习
2025-10-06 v3 人工智能
密码学与安全
摘要
文本到图像扩散模型的激增引发了重大的隐私与安全担忧,尤其是在生成受版权保护或有害图像方面。作为应对,概念擦除(防御)方法被开发出来,通过事后微调来“遗忘”特定概念。然而,近期的概念恢复(攻击)方法表明,这些据称已被擦除的概念可以使用对抗性构造的提示词恢复,揭示了当前防御机制中的一个关键脆弱性。在本研究中,我们首先调查了对抗性脆弱性的根本来源,并发现这种脆弱性在概念擦除模型的提示词嵌入空间中普遍存在,这一特征继承自原始的未学习模型。此外,我们引入了 **RECORD**,一种基于坐标下降的新型恢复算法,其性能持续优于现有恢复方法高达 17.8 倍。我们进行了广泛的实验以评估其计算性能权衡,并提出了加速策略。
引用
@article{arxiv.2502.17537,
title = {Rethinking the Vulnerability of Concept Erasure and a New Method},
author = {Alex D. Richardson and Kaicheng Zhang and Lucas Beerens and Dongdong Chen},
journal= {arXiv preprint arXiv:2502.17537},
year = {2025}
}