中文

关于对抗攻击对神经文本分类器可迁移性的研究

机器学习 2021-09-23 v3 计算与语言

摘要

深度神经网络易受对抗攻击,即对输入的小扰动会改变模型预测。在许多情况下,为一个模型精心构造的恶意输入可以欺骗另一个模型。在本文中,我们首次系统地研究文本分类模型对抗样本的可迁移性,并探讨网络架构、分词方案、词嵌入和模型容量等各种因素如何影响对抗样本的可迁移性。基于这些研究,我们提出一种遗传算法来寻找一组模型集成,可用于诱导对抗样本以欺骗几乎所有现有模型。此类对抗样本反映了学习过程中的缺陷以及训练集中的数据偏差。最后,我们从这些对抗样本中推导出可用于模型诊断的词替换规则。

关键词

引用

@article{arxiv.2011.08558,
  title  = {On the Transferability of Adversarial Attacksagainst Neural Text Classifier},
  author = {Liping Yuan and Xiaoqing Zheng and Yi Zhou and Cho-Jui Hsieh and Kai-wei Chang},
  journal= {arXiv preprint arXiv:2011.08558},
  year   = {2021}
}