中文

深度文本分类可被欺骗

密码学与安全 2019-01-08 v2 机器学习

摘要

在本文中,我们提出了一种有效的生成文本对抗样本的方法,揭示了一个重要却被低估的事实:基于DNN的文本分类器同样容易受到对抗样本攻击。具体而言,面对不同的对抗场景,通过计算得到输入的成本梯度(白盒攻击)或生成一系列遮挡测试样本(黑盒攻击)来识别对分类重要的文本项。基于这些文本项,我们设计了三种扰动策略,即插入、修改和删除,以生成对抗样本。实验结果表明,我们的方法生成的对抗样本能够成功欺骗当前最先进的基于字符级和词级的DNN文本分类器。这些对抗样本可以被扰动到任意期望的类别而不损害其效用。同时,所引入的扰动难以被察觉。

关键词

引用

@article{arxiv.1704.08006,
  title  = {Deep Text Classification Can be Fooled},
  author = {Bin Liang and Hongcheng Li and Miaoqiang Su and Pan Bian and Xirong Li and Wenchang Shi},
  journal= {arXiv preprint arXiv:1704.08006},
  year   = {2019}
}

备注

8 pages