中文

面向文本分类的具有自然触发词的通用的对抗攻击

计算与语言 2021-04-09 v2 密码学与安全

摘要

近期工作已证明现代文本分类器对通用对抗攻击的脆弱性,此类攻击为添加至分类器所处理文本的输入无关词序列。尽管成功,此类攻击产生的词序列常不合语法,且易与自然文本区分。我们开发了更接近自然英语短语却在添加至良性输入时迷惑分类系统的对抗攻击。我们利用对抗正则化自编码器(ARAE)生成触发词,并提出一种基于梯度的搜索以最大化下游分类器的预测损失。我们的攻击有效降低了分类任务上的模型准确率,且依据自动检测指标与人工受试者研究,比先前模型更不易辨识。我们的目的在于证明对抗攻击可较既往所认为的更难检测,并助力相应防御手段的发展。

关键词

引用

@article{arxiv.2005.00174,
  title  = {Universal Adversarial Attacks with Natural Triggers for Text Classification},
  author = {Liwei Song and Xinwei Yu and Hsuan-Tung Peng and Karthik Narasimhan},
  journal= {arXiv preprint arXiv:2005.00174},
  year   = {2021}
}

备注

Accepted by NAACL 2021, code is available at https://github.com/Hsuan-Tung/universal_attack_natural_trigger