中文

共享对抗性遗忘:通过遗忘共享对抗样本进行后门缓解

机器学习 2023-07-21 v1 密码学与安全

摘要

后门攻击是对机器学习模型的严重安全威胁,攻击者可将投毒样本注入训练集,导致模型被植入后门,将带有特定触发器的投毒样本预测为特定目标类,而在良性样本上表现正常。本文探索使用小型干净数据集净化后门模型的任务。通过建立后门风险与对抗风险之间的联系,我们推导出一种后门风险的新上界,其主要刻画后门模型与净化模型之间共享对抗样本(SAEs)上的风险。该上界进一步引出一个利用对抗训练技术缓解后门的新双层优化问题。为求解该问题,我们提出共享对抗性遗忘(SAU)。具体而言,SAU 首先生成 SAEs,然后遗忘所生成的 SAEs,使净化模型对其正确分类和/或两模型对其分类不同,从而在后门模型中的后门效应于净化模型中被缓解。在多个基准数据集和网络架构上的实验表明,我们所提方法取得了最先进的后门防御性能。

关键词

引用

@article{arxiv.2307.10562,
  title  = {Shared Adversarial Unlearning: Backdoor Mitigation by Unlearning Shared Adversarial Examples},
  author = {Shaokui Wei and Mingda Zhang and Hongyuan Zha and Baoyuan Wu},
  journal= {arXiv preprint arXiv:2307.10562},
  year   = {2023}
}