学习判别扰动以阻止文本分类中的对抗攻击
计算与语言
2019-09-10 v1
摘要
针对机器学习模型的对抗攻击已威胁到垃圾邮件过滤和情感分析等多种现实应用。本文提出了一种新颖的框架——学习判别扰动(DISP),用于识别并调整恶意扰动,从而阻止针对文本分类模型的对抗攻击。为识别对抗攻击,扰动判别器验证文本中每个词元被扰动的可能性,并提供一组潜在的扰动。对于每个潜在扰动,嵌入估计器学习基于上下文恢复原始词的嵌入,并通过近似k近邻搜索选择替换词元。DISP可在不修改模型结构或训练过程的情况下,为任何NLP模型阻止对抗攻击。在两个基准数据集上的大量实验表明,DISP在阻止文本分类对抗攻击方面显著优于基线方法。此外,深入分析显示了DISP在不同情境下的鲁棒性。
引用
@article{arxiv.1909.03084,
title = {Learning to Discriminate Perturbations for Blocking Adversarial Attacks in Text Classification},
author = {Yichao Zhou and Jyun-Yu Jiang and Kai-Wei Chang and Wei Wang},
journal= {arXiv preprint arXiv:1909.03084},
year = {2019}
}
备注
10 pages, 8 tables, 4 figures