中文

用于情感分类的灰盒对抗攻击与防御

机器学习 2021-03-23 v1 人工智能 计算与语言

摘要

我们引入了一种用于情感分类的灰盒对抗攻击与防御框架。我们在一个统一框架中解决了对抗攻击与防御的可微性、标签保持和输入重建问题。我们的结果表明,一旦训练完成,攻击模型能够比最先进的攻击方法显著更快地(时间减少一个数量级)生成高质量对抗样本。根据人工评估,这些样本也保持了原始情感。此外,我们的框架产生了一个改进的分类器,该分类器在防御多种对抗攻击方法时具有鲁棒性。代码见:https://github.com/ibm-aur-nlp/adv-def-text-dist。

关键词

引用

@article{arxiv.2103.11576,
  title  = {Grey-box Adversarial Attack And Defence For Sentiment Classification},
  author = {Ying Xu and Xu Zhong and Antonio Jimeno Yepes and Jey Han Lau},
  journal= {arXiv preprint arXiv:2103.11576},
  year   = {2021}
}