中文

SHIELD:利用随机多专家修补器防御文本神经网络抵御多种黑盒对抗攻击

机器学习 2022-03-17 v2 计算与语言 密码学与安全

摘要

尽管已有若干方法提出用于防御文本神经网络(NN)模型免受黑盒对抗攻击,但它们通常只针对特定的文本扰动策略进行防御,和/或需要从头重新训练模型。这导致在实际中缺乏泛化能力并产生冗余计算。特别是,最先进的 transformer 模型(如 BERT、RoBERTa)需要大量的时间与计算资源。受软件工程思想启发,为解决这些局限,我们提出了一种新算法 SHIELD,它仅修改并重新训练文本 NN 的最后一层,从而将 NN“修补”并“转换”为随机加权集成的多专家预测头。考虑到当前大多数黑盒攻击依赖迭代搜索机制来优化其对抗扰动,SHIELD 通过根据输入自动使用不同的预测器加权集成来迷惑攻击者。换言之,SHIELD 打破了攻击的一个基本假设,即受害 NN 模型在攻击期间保持不变。通过全面的实验,我们证明所有基于 CNN、RNN、BERT 和 RoBERTa 的文本 NN,一旦经 SHIELD 修补,在 14 种不同的黑盒攻击下准确率平均相对提升 15%–70%,并在 3 个公开数据集上优于 6 种防御基线。所有代码将公开发布。

关键词

引用

@article{arxiv.2011.08908,
  title  = {SHIELD: Defending Textual Neural Networks against Multiple Black-Box Adversarial Attacks with Stochastic Multi-Expert Patcher},
  author = {Thai Le and Noseong Park and Dongwon Lee},
  journal= {arXiv preprint arXiv:2011.08908},
  year   = {2022}
}

备注

Accepted to the 60th Annual Meeting of the Association for Computational Linguistics (ACL'22)