基于深度网络引导的多目标遗传优化的文本分类器黑盒对抗攻击
人工智能
2020-11-11 v2
摘要
我们提出一种新颖的遗传算法技术,可生成成功欺骗基于神经网络的文本分类器的黑盒对抗样本。我们执行由深度学习推断引导的多目标优化遗传搜索,并结合 Seq2Seq 变异来生成语义相似但难以察觉的对抗样本。我们在 SST 与 IMDB 情感数据集上,通过攻击三个训练模型(即 char-LSTM、word-LSTM 与 elmo-LSTM)将我们的方法与 DeepWordBug(DWB)进行比较。平均而言,我们在 SST 上实现 65.67% 的攻击成功率、在 IMDB 上实现 36.45% 的攻击成功率,分别显示出 49.48% 与 101% 的提升。此外,我们的定性研究表明,94% 的情况下用户无法区分原始样本与对抗样本。
引用
@article{arxiv.2011.03901,
title = {Adversarial Black-Box Attacks On Text Classifiers Using Multi-Objective Genetic Optimization Guided By Deep Networks},
author = {Alex Mathai and Shreya Khare and Srikanth Tamilselvam and Senthil Mani},
journal= {arXiv preprint arXiv:2011.03901},
year = {2020}
}