以输出随机化挫败有限差分对抗攻击
机器学习
2019-05-27 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
对抗样本在多种场景下对深度神经网络模型构成威胁,从 adversary 完全掌握模型信息的设定到相反的“黑盒”设定。黑盒攻击尤其具有威胁性,因为 adversary 仅需访问模型的输入和输出。防御黑盒对抗样本生成攻击至关重要,因为当前提出的防御措施无效。由于这类攻击依赖对模型的重复查询来估计输入维度上的梯度,我们研究使用随机化来阻止此类 adversary 成功创建对抗样本。应用于深度神经网络模型输出的随机化有可能迷惑潜在攻击者,但这引入了准确率与鲁棒性之间的权衡。我们表明,对于某些类型的随机化,我们可以通过仔细设置分布参数来界定引入错误的概率。对于有限差分黑盒攻击这一具体情况,我们量化了防御在梯度的有限差分估计中引入的误差。最后,我们通过实验表明该防御能够挫败两种自适应黑盒对抗攻击算法。
引用
@article{arxiv.1905.09871,
title = {Thwarting finite difference adversarial attacks with output randomization},
author = {Haidar Khan and Daniel Park and Azer Khan and Bülent Yener},
journal= {arXiv preprint arXiv:1905.09871},
year = {2019}
}