中文

生成自然语言对抗样本

计算与语言 2018-09-26 v2

摘要

深度神经网络(DNNs)易受对抗样本的攻击,即对已正确分类样本施加扰动可致使模型误分类。在图像领域,此类扰动往往在人的感知上几乎无法分辨,导致人类与最先进模型判断不一致。然而,在自然语言领域,微小扰动清晰可辨,且单个词语的替换会剧烈改变文本的语义。面对这些挑战,我们采用一种黑盒的基于种群的优化算法,生成语义与句法相似的对抗样本,分别以 97% 和 70% 的成功率欺骗训练良好的情感分析与文本蕴含模型。我们进一步证明,92.3% 的成功情感分析对抗样本被 20 名人类标注者分类回其原始标签,且这些样本在感知上极为相似。最后,我们探讨以对抗训练作为防御的尝试,但未能带来改进,显示出我们对抗样本的强悍性与多样性。希望我们的发现能鼓励研究者致力于提升 DNNs 在自然语言领域的鲁棒性。

关键词

引用

@article{arxiv.1804.07998,
  title  = {Generating Natural Language Adversarial Examples},
  author = {Moustafa Alzantot and Yash Sharma and Ahmed Elgohary and Bo-Jhang Ho and Mani Srivastava and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:1804.07998},
  year   = {2018}
}

备注

Accepted in EMNLP 2018 (Conference on Empirical Methods in Natural Language Processing)