基于通用规则欺骗深度神经网络文本分类器
机器学习
2019-04-04 v2 计算与语言
密码学与安全
机器学习
摘要
近来,基于深度学习的自然语言处理技术被广泛用于处理垃圾邮件、社交网络审查评估等任务。然而,评估此类深度神经网络脆弱性的工作仅有少数几篇。在此,我们超越攻击本身,首次研究通用规则,即与样本无关、从而可将任意文本样本变为对抗样本的规则。事实上,通用规则不使用方法本身的任何信息(未使用方法的任何信息、梯度信息或训练数据集信息),使其成为黑盒通用攻击。换言之,通用规则与样本和方法均无关。通过提出一种协同进化优化算法,我们表明可以创建通用规则,自动生成难以察觉的对抗样本(仅在文本样本中插入少于五个接近拼写错误的扰动)。与随机搜索算法的比较进一步证明了该方法的有效性。因此,本文表明欺骗网络的通用规则确实存在。希望本工作的结果将影响更多与样本和模型无关的攻击及其防御的发展,或许终将开启人工智能的新时代。
引用
@article{arxiv.1901.07132,
title = {Universal Rules for Fooling Deep Neural Networks based Text Classification},
author = {Di Li and Danilo Vasconcellos Vargas and Sakurai Kouichi},
journal= {arXiv preprint arXiv:1901.07132},
year = {2019}
}