中文

对抗性权重扰动能否注入神经后门?

机器学习 2020-09-22 v2 密码学与安全 机器学习

摘要

对抗机器学习已暴露出神经模型的若干安全危害,并成为近来重要的研究课题。迄今为止,“对抗扰动”的概念仅被用于指代输入空间,即一个微小、难以察觉的改变可使ML模型出错。本工作中我们将“对抗扰动”的思想扩展到模型权重空间,具体用于在训练好的DNN中注入后门,这暴露了使用公开可用训练模型的安全风险。此处注入后门指的是当输入加入触发模式时使模型得到期望输出,同时在非触发输入上保持原模型预测。从攻击者视角,我们将这些对抗扰动刻画为约束于原始模型权重周围的\ell_{\infty}范数内。我们利用原始模型预测与期望触发上的复合损失,通过投影梯度下降在模型权重中引入对抗扰动。我们凭经验表明这些对抗权重扰动在多个计算机视觉与自然语言处理任务中普遍存在的。我们的结果显示,对于若干应用,后门可被成功注入,且模型权重值的平均相对改变非常小。

关键词

引用

@article{arxiv.2008.01761,
  title  = {Can Adversarial Weight Perturbations Inject Neural Backdoors?},
  author = {Siddhant Garg and Adarsh Kumar and Vibhor Goel and Yingyu Liang},
  journal= {arXiv preprint arXiv:2008.01761},
  year   = {2020}
}

备注

Accepted as a conference paper at CIKM 2020