中文

基于深度网络引导的多目标遗传优化的文本分类器黑盒对抗攻击

人工智能 2020-11-11 v2

摘要

我们提出一种新颖的遗传算法技术,可生成成功欺骗基于神经网络的文本分类器的黑盒对抗样本。我们执行由深度学习推断引导的多目标优化遗传搜索,并结合 Seq2Seq 变异来生成语义相似但难以察觉的对抗样本。我们在 SST 与 IMDB 情感数据集上,通过攻击三个训练模型(即 char-LSTM、word-LSTM 与 elmo-LSTM)将我们的方法与 DeepWordBug(DWB)进行比较。平均而言,我们在 SST 上实现 65.67% 的攻击成功率、在 IMDB 上实现 36.45% 的攻击成功率,分别显示出 49.48% 与 101% 的提升。此外,我们的定性研究表明,94% 的情况下用户无法区分原始样本与对抗样本。

关键词

引用

@article{arxiv.2011.03901,
  title  = {Adversarial Black-Box Attacks On Text Classifiers Using Multi-Objective Genetic Optimization Guided By Deep Networks},
  author = {Alex Mathai and Shreya Khare and Srikanth Tamilselvam and Senthil Mani},
  journal= {arXiv preprint arXiv:2011.03901},
  year   = {2020}
}