中文

硬标签黑盒设定下自然语言攻击的生成

计算与语言 2021-04-30 v2

摘要

我们研究了一项重要且具有挑战性的任务:在硬标签黑盒设定下攻击自然语言处理模型。我们提出了一种基于决策的攻击策略,可在文本分类与蕴含任务上生成高质量的对抗样本。我们所提攻击策略利用基于种群的优化算法,仅通过观察目标模型预测的最高标签来生成合理且语义相似的对抗样本。在每次迭代中,优化过程允许进行使原始文本与对抗文本之间整体语义相似度最大的词语替换。此外,我们的方法不依赖于使用替代模型或任何类型的训练数据。我们通过五个最先进目标模型在七个基准数据集上的广泛实验与消融研究证明了所提方法的有效性。与先前文献提出的攻击相比,我们能够在高度受限的设定下以更低的词语扰动比例实现更高的成功率。

关键词

引用

@article{arxiv.2012.14956,
  title  = {Generating Natural Language Attacks in a Hard Label Black Box Setting},
  author = {Rishabh Maheshwary and Saket Maheshwary and Vikram Pudi},
  journal= {arXiv preprint arXiv:2012.14956},
  year   = {2021}
}

备注

Accepted at AAAI 2021 (Main Conference)