中文

遗忘触发后门:一种干净反学习攻击

密码学与安全 2025-06-17 v1

摘要

机器反学习已成为确保"被遗忘权"的关键组成部分,能够从训练好的模型中移除特定数据点。然而,即使反学习在没有投毒遗忘集(干净反学习)的情况下执行,它也可能被利用于现有防御难以检测的隐蔽攻击。在本文中,我们提出了一种新颖的{\em 干净}后门攻击,它利用了模型学习阶段和随后的反学习请求。与传统的后门方法不同,在第一阶段,我们的方法在多个类别中注入了一个微弱的、分布式的恶意信号。然后,通过选择性地反学习{\em 未投毒}样本,真正的攻击被激活并放大。这种策略产生了一种强大且隐蔽的新型攻击,难以被检测或缓解,凸显了当前反学习机制中的关键漏洞,并强调了需要更稳健的防御措施。

关键词

引用

@article{arxiv.2506.12522,
  title  = {When Forgetting Triggers Backdoors: A Clean Unlearning Attack},
  author = {Marco Arazzi and Antonino Nocera and Vinod P},
  journal= {arXiv preprint arXiv:2506.12522},
  year   = {2025}
}