中文

基于梯度扰动的自然对抗句生成

信息检索 2019-09-11 v1 计算与语言 密码学与安全 机器学习

摘要

本工作提出了一种新颖的算法,用于为文本分类模型生成自然语言对抗输入,以研究这些模型的鲁棒性。该算法对用作分类器特征的句子嵌入应用基于梯度的扰动,并学习一个用于生成的解码器。我们将该方法应用于情感分析模型,并验证了其在诱导模型产生错误预测方面的有效性。我们还对这些示例进行了定量和定性分析,证明我们的方法能够生成更自然的对抗样本。此外,该方法还可用于成功执行黑盒攻击,即攻击参数未知的其他现有模型。在公开的情感分析API上,所提出的方法使平均准确率相对降低了20%,绝对误差相对增加了74%。

关键词

引用

@article{arxiv.1909.04495,
  title  = {Natural Adversarial Sentence Generation with Gradient-based Perturbation},
  author = {Yu-Lun Hsieh and Minhao Cheng and Da-Cheng Juan and Wei Wei and Wen-Lian Hsu and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:1909.04495},
  year   = {2019}
}