技术报告:机器学习何时FAIL?规避与投毒攻击的广义可迁移性
密码学与安全
2019-03-11 v2 机器学习
摘要
最近的结果表明,针对监督机器学习系统的攻击相当有效,而防御很容易被新的攻击绕过。然而,当前机器学习系统的规范缺乏精确的对手定义,且现有攻击对发起攻击的对手强度做出了多样的、潜在不切实际的假设。我们提出了FAIL攻击者模型,该模型沿四个维度描述了对手的知识和控制能力。我们的模型允许我们考虑广泛的弱对手,这些对手对所利用的特征、学习算法和训练实例的控制有限且知识不完整。为了评估FAIL模型的效用,我们考虑在现实环境中进行定向投毒攻击的问题:精心制作的投毒样本必须具有干净标签,必须在个体和集体上都不引人注目,并且必须表现出由FAIL模型定义的广义可迁移性。考虑到这些约束,我们设计了StingRay,这是一种定向投毒攻击,对使用3种不同学习算法的4个机器学习应用具有实用性,并且可以绕过2种现有的防御。相反,我们表明先前的规避攻击在广义可迁移性下效果较差。在FAIL对手模型下的此类攻击评估,也可能为未来的防御指明有希望的方向。
引用
@article{arxiv.1803.06975,
title = {Technical Report: When Does Machine Learning FAIL? Generalized Transferability for Evasion and Poisoning Attacks},
author = {Octavian Suciu and Radu Mărginean and Yiğitcan Kaya and Hal Daumé and Tudor Dumitraş},
journal= {arXiv preprint arXiv:1803.06975},
year = {2019}
}