基于梯度扰动的自然对抗句生成
信息检索
2019-09-11 v1 计算与语言
密码学与安全
机器学习
摘要
本工作提出了一种新颖的算法,用于为文本分类模型生成自然语言对抗输入,以研究这些模型的鲁棒性。该算法对用作分类器特征的句子嵌入应用基于梯度的扰动,并学习一个用于生成的解码器。我们将该方法应用于情感分析模型,并验证了其在诱导模型产生错误预测方面的有效性。我们还对这些示例进行了定量和定性分析,证明我们的方法能够生成更自然的对抗样本。此外,该方法还可用于成功执行黑盒攻击,即攻击参数未知的其他现有模型。在公开的情感分析API上,所提出的方法使平均准确率相对降低了20%,绝对误差相对增加了74%。
引用
@article{arxiv.1909.04495,
title = {Natural Adversarial Sentence Generation with Gradient-based Perturbation},
author = {Yu-Lun Hsieh and Minhao Cheng and Da-Cheng Juan and Wei Wei and Wen-Lian Hsu and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:1909.04495},
year = {2019}
}