中文

攻破 De-Pois 中毒防御

机器学习 2022-04-05 v1 密码学与安全

摘要

自机器学习模型问世以来,针对其的攻击一直是一个极其顽固且难以察觉的问题,宛如一场无尽的猫鼠游戏。此类攻击的一个主要变体是中毒攻击,可间接操纵机器学习模型。多年来观察到,大多数所提出的有效防御模型仅在攻击者不知晓其被部署时才有效。本文中,我们表明与攻击无关的 De-Pois 防御也很难例外于该规律。事实上,我们展示了当攻击者知晓 De-Pois 防御模型结构时,其对最简单的白盒与黑盒攻击的脆弱性。本质上,De-Pois 防御依赖于一个评判模型,该模型可在将中毒数据传入目标模型前检测之。在我们的工作中,我们通过复现该评判模型,并对评判模型与目标模型同时执行组合的梯度符号攻击,从而打破这一防毒层——使我们能够绕过评判防火墙以中毒目标模型。

关键词

引用

@article{arxiv.2204.01090,
  title  = {Breaking the De-Pois Poisoning Defense},
  author = {Alaa Anani and Mohamed Ghanem and Lotfy Abdel Khaliq},
  journal= {arXiv preprint arXiv:2204.01090},
  year   = {2022}
}