中文

使用深度强化模型为文本分类器生成黑盒对抗样本

机器学习 2021-03-03 v1 计算与语言 信息检索 机器学习

摘要

近来,生成对抗样本已成为衡量深度学习模型鲁棒性的重要手段。对抗样本帮助我们识别模型的易感性,并进一步通过应用对抗训练技术来应对这些脆弱性。在自然语言领域,以拼写错误或释义形式出现的小扰动可剧烈改变文本的语义。我们提出了一种基于强化学习的方法,用于在黑盒设定下生成对抗样本。我们证明了我们的方法能够以显著高的成功率欺骗(a)IMDB 情感分类任务和(b)AG 新闻语料库新闻分类任务上训练良好的模型。我们发现生成的对抗样本是对原始文本的保留语义的扰动。

关键词

引用

@article{arxiv.1909.07873,
  title  = {Generating Black-Box Adversarial Examples for Text Classifiers Using a Deep Reinforced Model},
  author = {Prashanth Vijayaraghavan and Deb Roy},
  journal= {arXiv preprint arXiv:1909.07873},
  year   = {2021}
}

备注

16 pages, 3 figures, ECML PKDD 2019