自然语言处理中深度学习模型的对抗攻击:综述
计算与语言
2019-04-12 v3
摘要
随着高算力设备的发展,深度神经网络(DNNs)近年来在许多人工智能(AI)应用中获得了广泛关注。然而,已有研究表明 DNNs 易受经过策略性修改的样本(称为对抗样本)的影响。这些样本通过某些难以察觉的扰动生成,却能够欺骗 DNNs 给出错误预测。受图像 DNNs 对抗样本生成热潮的启发,近年来针对文本应用的 DNNs 攻击研究开始出现。然而,现有的图像扰动方法无法直接应用于文本,因为文本数据是离散的。在本文中,我们综述了解决这一差异并生成文本对抗样本的相关研究工作。我们以全面的方式收集、筛选、总结、讨论并分析了这些工作,涵盖了所有相关信息以使本文自成体系。最后,基于所综述的文献,我们对该主题提供了进一步的讨论与建议。
引用
@article{arxiv.1901.06796,
title = {Adversarial Attacks on Deep Learning Models in Natural Language Processing: A Survey},
author = {Wei Emma Zhang and Quan Z. Sheng and Ahoud Alhazmi and Chenliang Li},
journal= {arXiv preprint arXiv:1901.06796},
year = {2019}
}
备注
40