中文

离散对抗攻击与子模优化及其在文本分类中的应用

机器学习 2019-04-08 v2 密码学与安全 最优化与控制 机器学习

摘要

对抗样本是对输入精心构造的修改,能完全改变分类器的输出但对人类不可察觉。尽管针对连续数据(如图像和音频样本)的这些成功攻击已经存在,为文本等离散结构生成对抗样本已被证明明显更具挑战性。本文将具有离散输入的攻击表述为集合函数上的优化任务。我们证明在某些简化假设下,该集合函数对于一些流行的神经网络文本分类器是子模的。这一发现保证了使用贪婪算法的攻击具有 11/e1-1/e 的近似因子。同时,我们展示了如何利用被攻击分类器的梯度来引导贪婪搜索。使用我们提出的优化方案的实证研究表明,在三个不同的文本分类任务上,相对于各种基线方法,攻击能力和效率均有显著提升。我们还使用句子与词联合释义技术来保持文本原有的语义和句法。这通过人工主观评价对我们生成的对抗文本的质量和语义连贯性进行了验证。

关键词

引用

@article{arxiv.1812.00151,
  title  = {Discrete Adversarial Attacks and Submodular Optimization with Applications to Text Classification},
  author = {Qi Lei and Lingfei Wu and Pin-Yu Chen and Alexandros G. Dimakis and Inderjit S. Dhillon and Michael Witbrock},
  journal= {arXiv preprint arXiv:1812.00151},
  year   = {2019}
}

备注

In SysML 2019