中文

DANCin SEQ2SEQ:以对抗文本样例生成愚弄文本分类器

机器学习 2017-12-18 v1 密码学与安全

摘要

机器学习模型强大但易出错。生成对抗样例——即刻意构造以引发模型误分类或其他错误的输入——可揭示模型假设与漏洞的重要洞见。尽管近期针对图像分类器的对抗样例生成已有大量工作,探索文本分类器对抗样例生成的研究仍相对较少;此外,许多现有对抗样例生成算法需要目标模型参数的完全访问权限,使其在诸多现实攻击中难以实用。本工作中,我们提出 DANCin SEQ2SEQ,一种受 GAN 启发的、针对大体黑盒文本分类器的对抗文本样例生成算法。我们将对抗文本样例生成重新表述为强化学习问题,并证明我们的算法在现实攻击场景下生成语义有意义的对抗文本样例方面迈出了初步而富有前景的步伐。

关键词

引用

@article{arxiv.1712.05419,
  title  = {DANCin SEQ2SEQ: Fooling Text Classifiers with Adversarial Text Example Generation},
  author = {Catherine Wong},
  journal= {arXiv preprint arXiv:1712.05419},
  year   = {2017}
}