中文

AEGIS:对抗性目标引导的保留数据自由鲁棒概念擦除

机器学习 2026-02-16 v2 人工智能 密码学与安全

摘要

概念擦除有助于阻止扩散模型(DM)生成有害内容;但当前方法面临鲁棒性与保留之间的权衡。鲁棒性指模型经概念擦除方法微调后仍能抵抗被擦除概念的重新激活,即使在语义相关提示下亦然。保留则指保持与被擦除无关概念的完整,以维持模型的整体实用性。两者在实际应用中都至关重要,但同时实现却富有挑战性,因为现有工作通常在其中一项上取得进展而牺牲另一项。例如,单一被擦除提示映射到固定安全目标会留下可被提示攻击利用的类别级残留;而保留导向的方案则在面对自适应对手时表现不佳。本文引入 Adversarial Erasure with Gradient Informed Synergy(AEGIS),一种保留数据自由的框架,推动鲁棒性与保留双重提升。

关键词

引用

@article{arxiv.2602.06771,
  title  = {AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models},
  author = {Fengpeng Li and Kemou Li and Qizhou Wang and Bo Han and Jiantao Zhou},
  journal= {arXiv preprint arXiv:2602.06771},
  year   = {2026}
}

备注

30 pages,12 figures