中文

多概念对抗攻击

机器学习 2021-10-22 v1 人工智能 密码学与安全 最优化与控制 机器学习

摘要

随着机器学习(ML)技术在众多应用中的使用日益增多,其对对抗攻击的脆弱性已广为人知。测试时攻击通常通过向测试样本添加对抗噪声来实施,已被证明对部署的ML模型有效。在实践中,一个测试输入可能被不同的ML模型所利用。针对单一ML模型的测试时攻击往往忽视其对其他ML模型的影响。在本工作中,我们通过实验证明,朴素地攻击学习某一概念的 classifier 可能会对学习其他概念的 classifier 产生负面影响。例如,在在线图像分类场景中,当性别(Gender)分类器受到攻击时,(佩戴)眼镜(Glasses)分类器同时被攻击,准确率从98.69降至88.42。这引出了一个有趣的问题:是否可能攻击一组分类器而不影响使用同一测试实例的另一组分类器?上述研究问题的答案对于防范ML模型滥用以保护隐私具有有趣的意义。攻击那些带来不必要隐私侵犯风险的ML模型,可以成为保护个人免受有害隐私剥削的重要工具。本文通过开发新颖的攻击技术来解决上述研究问题,这些技术能够同时攻击一组ML模型,同时保持另一组模型的准确率。对于线性分类器,我们提供了寻找生成此类对抗样本最优解的理论框架。利用该理论框架,我们在深度学习背景下开发了多概念攻击策略。我们的结果表明,我们的技术能够在多种不同设置下成功攻击目标类别同时保护受保护类别,而现有的测试时单攻击策略无法做到这一点。

关键词

引用

@article{arxiv.2110.10287,
  title  = {Multi-concept adversarial attacks},
  author = {Vibha Belavadi and Yan Zhou and Murat Kantarcioglu and Bhavani M. Thuraisingham},
  journal= {arXiv preprint arXiv:2110.10287},
  year   = {2021}
}

备注

20 pages, 28 figures, 9 tables