关于利用梯度整形缓解数据投毒攻击的有效性
密码学与安全
2020-03-02 v2 机器学习
摘要
机器学习算法易受数据投毒攻击。先前关注特定场景(如非定向或定向)的分类法已实现对相应已知攻击子集的防御。然而,这引入了攻防之间不可避免的军备竞赛。在这项工作中,我们研究依赖于所有投毒攻击共有伪影的攻击无关防御的可行性。具体而言,我们关注所有攻击之间的共同要素:它们修改了为训练模型而计算的梯度。我们识别出在投毒存在时计算出的梯度的两个主要伪影:(1)其 范数幅值显著高于干净梯度,且(2)其方向与干净梯度不同。基于这些观察,我们提出通用投毒防御的先决条件:必须约束梯度幅值并最小化方向差异。我们称之为梯度整形。作为评估梯度整形可行性的示例工具,我们使用差分隐私随机梯度下降(DP-SGD),它在训练期间裁剪并扰动个体梯度以获得隐私保证。我们发现 DP-SGD 即使在未产生有意义隐私保证的配置下,也提升了模型对非定向攻击的鲁棒性。它还缓解了最坏情况定向攻击,并增加了多投毒场景中攻击者的成本。我们发现 DP-SGD 唯一无效的攻击是一种强大却不现实的的非定向攻击。我们的结果表明,尽管我们目前缺乏通用投毒防御,梯度整形是未来研究一个有前景的方向。
引用
@article{arxiv.2002.11497,
title = {On the Effectiveness of Mitigating Data Poisoning Attacks with Gradient Shaping},
author = {Sanghyun Hong and Varun Chandrasekaran and Yiğitcan Kaya and Tudor Dumitraş and Nicolas Papernot},
journal= {arXiv preprint arXiv:2002.11497},
year = {2020}
}