规避深度学习分类器的对抗性文本序列黑盒生成
计算与语言
2018-05-24 v5 密码学与安全
信息检索
机器学习
摘要
尽管已有多种技术被提出用于生成针对文本的白盒攻击对抗样本,但作为更现实场景的黑盒攻击却鲜受关注。本文提出一种新算法 DeepWordBug,可在黑盒设定下有效生成微小文本扰动,迫使深度学习分类器对文本输入产生误分类。我们采用新颖的评分策略来识别关键 token,若对其修改会导致分类器作出错误预测。对排名最高的 token 施加简单的字符级变换,以最小化扰动的编辑距离,同时改变原始分类。我们在八个真实世界文本数据集上评估了 DeepWordBug,包括文本分类、情感分析和垃圾邮件检测。我们将 DeepWordBug 的结果与两个基线进行比较:Random(黑盒)与 Gradient(白盒)。实验结果表明,DeepWordBug 降低了当前最先进深度学习模型的预测准确率,其中 Word-LSTM 模型平均下降 68%,Char-CNN 模型平均下降 48%。
引用
@article{arxiv.1801.04354,
title = {Black-box Generation of Adversarial Text Sequences to Evade Deep Learning Classifiers},
author = {Ji Gao and Jack Lanchantin and Mary Lou Soffa and Yanjun Qi},
journal= {arXiv preprint arXiv:1801.04354},
year = {2018}
}
备注
This is an extended version of the 6page Workshop version appearing in 1st Deep Learning and Security Workshop colocated with IEEE S&P