面向文本分类的通用对抗扰动
计算与语言
2019-10-11 v1 机器学习
机器学习
摘要
给定一个最先进的深度神经网络文本分类器,我们展示了存在一种通用且非常小的扰动向量(在嵌入空间中),能以高概率使自然文本被误分类。与可找到单一固定尺寸对抗扰动的图像不同,文本长度可变,因此我们将“通用性”定义为“词元无关”,即对每一个词元施加单一扰动,从而在序列层面产生尺寸灵活的不同扰动。我们提出一种计算通用对抗扰动的算法,并表明最先进的深度神经网络对它们高度脆弱,即便它们大体保留了词元的邻域。我们还展示了如何利用这些对抗扰动生成对抗文本样本。这种通用“词元无关”对抗扰动的惊人存在可能揭示了文本分类器的重要性质。
引用
@article{arxiv.1910.04618,
title = {Universal Adversarial Perturbation for Text Classification},
author = {Hang Gao and Tim Oates},
journal= {arXiv preprint arXiv:1910.04618},
year = {2019}
}