中文

对抗性神经元剪枝净化后门深度模型

机器学习 2021-10-28 v1 密码学与安全 计算机视觉与模式识别

摘要

随着深度神经网络(DNNs)规模增大,其对计算资源的需求变得巨大,这使得外包训练更为流行。然而,在第三方平台训练可能引入潜在风险:恶意训练方会返回后门 DNNs,其在干净样本上表现正常,但一旦测试时出现触发器便输出定向误分类。在不知晓触发器的情形下,难以从后门模型中区分或恢复良性 DNNs。本文中,我们首先识别出后门 DNNs 一种意外的敏感性,即当其神经元被对抗性扰动时,它们更易崩溃且倾向于在干净样本上预测目标标签。基于这些观察,我们提出一种新颖的模型修复方法,称为对抗性神经元剪枝(ANP),其剪除若干敏感神经元以净化注入的后门。实验表明,即便仅用极少量干净数据(如 1%),ANP 也能有效移除注入的后门而不造成明显性能下降。

关键词

引用

@article{arxiv.2110.14430,
  title  = {Adversarial Neuron Pruning Purifies Backdoored Deep Models},
  author = {Dongxian Wu and Yisen Wang},
  journal= {arXiv preprint arXiv:2110.14430},
  year   = {2021}
}

备注

To appear in NeurIPS 2021