中文

文本分类中的模型鲁棒性:保语义对抗攻击

计算与语言 2020-08-17 v2 机器学习

摘要

我们提出用于生成对抗攻击的算法,以评估文本分类问题中的模型鲁棒性。这些算法可用于生成白盒攻击与黑盒攻击,同时保留原始文本的语义与句法。这些攻击在白盒设定下引发了大量的标签翻转,而相同的基于规则的攻击可用于黑盒设定。在黑盒设定下,所生成的攻击能够逆转基于Transformer架构的决策。

关键词

引用

@article{arxiv.2008.05536,
  title  = {Model Robustness with Text Classification: Semantic-preserving adversarial attacks},
  author = {Rahul Singh and Tarun Joshi and Vijayan N. Nair and Agus Sudjianto},
  journal= {arXiv preprint arXiv:2008.05536},
  year   = {2020}
}

备注

12 Pages, 3 Figures, 10 Tables