中文

基于隐式超梯度的后门对抗式遗忘

机器学习 2022-02-08 v4 密码学与安全 计算机视觉与模式识别

摘要

我们提出了一种基于少量干净数据从给定中毒模型中移除后门的最小最大(minimax)形式化方法。该形式化涵盖了先前许多后门移除工作。我们提出了隐式后门对抗式遗忘(I-BAU)算法来求解该最小最大问题。与以往将最小最大分解为独立内外问题的研究不同,我们的算法利用隐式超梯度(implicit hypergradient)来考虑内外优化之间的相互依赖关系。我们从理论上分析了其收敛性,以及通过在干净数据上求解最小最大所获得的鲁棒性对未见测试数据的泛化能力。在评估中,我们在两个数据集和多种攻击设置(包括攻击者针对单一类的常见设置以及针对多类这一重要但未被充分探索的设置)上,将 I-BAU 与七种后门攻击下的六种最先进(state-of-art)后门防御方法进行比较。I-BAU 的性能与最佳基线相当,且在大多数情况下显著优于最佳基线。特别是,其性能对触发器、攻击设置、中毒比例和干净数据规模的变化更具鲁棒性。此外,I-BAU 生效所需计算量更少;尤其在单目标攻击设置下,它比最高效的基线快逾 13×13\times。进一步,在防御者仅能访问 100 个干净样本的极端情况下它仍保持有效——而所有基线在该设置下均无法产生可接受的结果。

关键词

引用

@article{arxiv.2110.03735,
  title  = {Adversarial Unlearning of Backdoors via Implicit Hypergradient},
  author = {Yi Zeng and Si Chen and Won Park and Z. Morley Mao and Ming Jin and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2110.03735},
  year   = {2022}
}

备注

In proceeding of the Tenth International Conference on Learning Representations (ICLR 2022)