SHIELD:利用随机多专家修补器防御文本神经网络抵御多种黑盒对抗攻击
机器学习
2022-03-17 v2 计算与语言
密码学与安全
摘要
尽管已有若干方法提出用于防御文本神经网络(NN)模型免受黑盒对抗攻击,但它们通常只针对特定的文本扰动策略进行防御,和/或需要从头重新训练模型。这导致在实际中缺乏泛化能力并产生冗余计算。特别是,最先进的 transformer 模型(如 BERT、RoBERTa)需要大量的时间与计算资源。受软件工程思想启发,为解决这些局限,我们提出了一种新算法 SHIELD,它仅修改并重新训练文本 NN 的最后一层,从而将 NN“修补”并“转换”为随机加权集成的多专家预测头。考虑到当前大多数黑盒攻击依赖迭代搜索机制来优化其对抗扰动,SHIELD 通过根据输入自动使用不同的预测器加权集成来迷惑攻击者。换言之,SHIELD 打破了攻击的一个基本假设,即受害 NN 模型在攻击期间保持不变。通过全面的实验,我们证明所有基于 CNN、RNN、BERT 和 RoBERTa 的文本 NN,一旦经 SHIELD 修补,在 14 种不同的黑盒攻击下准确率平均相对提升 15%–70%,并在 3 个公开数据集上优于 6 种防御基线。所有代码将公开发布。
引用
@article{arxiv.2011.08908,
title = {SHIELD: Defending Textual Neural Networks against Multiple Black-Box Adversarial Attacks with Stochastic Multi-Expert Patcher},
author = {Thai Le and Noseong Park and Dongwon Lee},
journal= {arXiv preprint arXiv:2011.08908},
year = {2022}
}
备注
Accepted to the 60th Annual Meeting of the Association for Computational Linguistics (ACL'22)