通过随机替换编码防御词级对抗攻击
计算与语言
2020-06-15 v2 机器学习
摘要
针对计算机视觉任务上深度神经网络的对抗攻击催生了许多新技术,有助于保护模型避免错误预测。近来,针对自然语言处理(NLP)任务深度模型的词级对抗攻击也展现出强大威力,例如愚弄情感分类神经网络做出错误决策。遗憾的是,由于此类基于词级同义词替换的攻击难以被察觉和检测,先前文献很少讨论其防御。本文关注该问题并提出一种称为随机替换编码(RSE)的新防御框架,其将随机替换编码器引入原始神经网络的训练过程。在文本分类任务上的大量实验证明了我们的框架在各种基模型和攻击模型下对词级对抗攻击防御的有效性。
引用
@article{arxiv.2005.00446,
title = {Defense of Word-level Adversarial Attacks via Random Substitution Encoding},
author = {Zhaoyang Wang and Hongtao Wang},
journal= {arXiv preprint arXiv:2005.00446},
year = {2020}
}
备注
12 pages, 2 figures, 4 tables. Accepted as a FULL paper at KSEM 2020