中文

Blacklight:面向神经网络抵御基于查询的黑盒攻击的可扩展防御

密码学与安全 2022-06-10 v3 计算机视觉与模式识别 机器学习

摘要

深度学习系统已知易受对抗样本攻击。特别地,基于查询的黑盒攻击不需要了解深度学习模型,而是可通过提交查询并检视返回结果,在网络上计算出对抗样本。近期工作大幅提升了此类攻击的效率,证明了它们在当今机器学习即服务平台上的实用性。我们提出 Blacklight,一种抵御基于查询的黑盒对抗攻击的新防御方法。驱动我们设计的核心洞见是:为计算对抗样本,这些攻击在网络上执行迭代优化,产生在输入空间中高度相似的图像查询。Blacklight 通过检测高度相似的查询来检测基于查询的黑盒攻击,使用一种基于概率内容指纹的高效相似性引擎。我们在多种模型与图像分类任务上,针对八种最先进的攻击评估了 Blacklight。Blacklight 全部识别出了它们,往往仅需少量查询。通过拒绝所有被检测到的查询,Blacklight 阻止了任何攻击的完成,即使攻击者在账户封禁或查询拒绝后持续提交查询。Blacklight 对若干强力对策也具有鲁棒性,包括一种在效率上逼近白盒攻击的最优黑盒攻击。最后,我们说明了 Blacklight 如何推广到文本分类等其他领域。

关键词

引用

@article{arxiv.2006.14042,
  title  = {Blacklight: Scalable Defense for Neural Networks against Query-Based Black-Box Attacks},
  author = {Huiying Li and Shawn Shan and Emily Wenger and Jiayun Zhang and Haitao Zheng and Ben Y. Zhao},
  journal= {arXiv preprint arXiv:2006.14042},
  year   = {2022}
}