使用深度强化模型为文本分类器生成黑盒对抗样本
机器学习
2021-03-03 v1 计算与语言
信息检索
机器学习
摘要
近来,生成对抗样本已成为衡量深度学习模型鲁棒性的重要手段。对抗样本帮助我们识别模型的易感性,并进一步通过应用对抗训练技术来应对这些脆弱性。在自然语言领域,以拼写错误或释义形式出现的小扰动可剧烈改变文本的语义。我们提出了一种基于强化学习的方法,用于在黑盒设定下生成对抗样本。我们证明了我们的方法能够以显著高的成功率欺骗(a)IMDB 情感分类任务和(b)AG 新闻语料库新闻分类任务上训练良好的模型。我们发现生成的对抗样本是对原始文本的保留语义的扰动。
引用
@article{arxiv.1909.07873,
title = {Generating Black-Box Adversarial Examples for Text Classifiers Using a Deep Reinforced Model},
author = {Prashanth Vijayaraghavan and Deb Roy},
journal= {arXiv preprint arXiv:1909.07873},
year = {2021}
}
备注
16 pages, 3 figures, ECML PKDD 2019