中文

利用生成模型大规模生成自然语言对抗样本

计算与语言 2020-03-24 v1 机器学习 机器学习

摘要

如今文本分类模型已被广泛使用。然而,这些分类器被发现很容易被对抗样本欺骗。幸运的是,标准攻击方法以成对方式生成对抗文本,即,只能通过替换少数词从真实文本创建对抗文本。在许多应用中,这些文本数量有限,因此其对应对抗样本往往不够多样且有时难以阅读,从而易被人类检测且无法大规模制造混乱。本文中,我们提出一种端到端方案,利用生成模型从零高效生成对抗文本,而不限于扰动给定文本。我们称之为无限制对抗文本生成。具体而言,我们训练一个带额外对抗损失的条件变分自编码器(VAE)以引导对抗样本的生成。此外,为提升对抗文本的有效性,我们利用判别器与生成对抗网络(GANs)的训练框架使对抗文本与真实数据一致。在情感分析上的实验结果表明了我们方法的可扩展性与高效性。它能以比现有方法更高的成功率攻击文本分类模型,同时为人类提供可接受的质量。

关键词

引用

@article{arxiv.2003.10388,
  title  = {Generating Natural Language Adversarial Examples on a Large Scale with Generative Models},
  author = {Yankun Ren and Jianbin Lin and Siliang Tang and Jun Zhou and Shuang Yang and Yuan Qi and Xiang Ren},
  journal= {arXiv preprint arXiv:2003.10388},
  year   = {2020}
}