中文

被抹除却不被遗忘:后门如何破坏概念抹除

密码学与安全 2025-05-01 v1 人工智能 机器学习

摘要

大规模文本到图像扩散模型的扩展引发了越来越多的担忧,这些模型可能生成令人不愿望或有害的内容,包括对公共人物的虚构描绘或露裂色情图像。为缓解这些风险,先前工作提出了机器遗忘技术,试图通过微调抹除不希望的概念。然而,本文引入一种新威胁模型——有毒遗忘(ToxE),并演示了最近的遗忘算法(包括专为鲁棒性设计的算法)如何通过针对性后门攻击被规避。该威胁通过建立触发器与不希望内容之间的链接来实现。随后的遗忘尝试未能抹除这一链接,使对手能够生成有害内容。我们通过两种已建立的后门攻击实现ToxE:一种针对文本编码器,另一种操控交叉注意力层。进一步,我们引入基于得分的深度干预攻击(DISA),这是一种新型更深层次的后门攻击,通过基于得分的目标优化整个U-Net,提高了该攻击在不同擦除方法下的持久性。我们对五种最近的概念擦除方法进行评估。对于明星身份擦除,我们的深度攻击以最高达82%的成功率实现规避,平均为57%。对于色情内容擦除,ToxE攻击可诱发出露裂身部位数达9倍,DISA平均提升系数为2.9倍。这些结果凸显了当前遗忘策略之间的关键安全漏洞。

关键词

引用

@article{arxiv.2504.21072,
  title  = {Erased but Not Forgotten: How Backdoors Compromise Concept Erasure},
  author = {Jonas Henry Grebe and Tobias Braun and Marcus Rohrbach and Anna Rohrbach},
  journal= {arXiv preprint arXiv:2504.21072},
  year   = {2025}
}