中文

MINIMAL:挖掘模型以生成无数据通用对抗触发词

计算与语言 2021-09-28 v1 人工智能 机器学习

摘要

众所周知,自然语言模型易受对抗攻击,且此类攻击多为特定于输入的性质。近来研究表明,NLP 模型中亦存在输入无关的攻击,称为通用对抗触发词。然而,现有生成通用触发词的方法数据密集。它们需要大量数据样本来生成对抗触发词,而攻击者通常无法获取这些数据。例如,先前工作针对 SNLI 数据集每类取 3000 个数据样本以生成对抗触发词。本文中,我们提出一种新颖的无数据方法 MINIMAL,从模型中挖掘输入无关的对抗触发词。使用我们无数据算法生成的触发词,我们将 Stanford Sentiment Treebank 正类的准确率从 93.6% 降至 9.6%。类似地,对于 Stanford Natural Language Inference(SNLI),我们的单字触发词将蕴含类的准确率从 90.95% 降至低于 0.6%。尽管完全无数据,我们获得了与数据依赖方法同等的准确率下降。

关键词

引用

@article{arxiv.2109.12406,
  title  = {MINIMAL: Mining Models for Data Free Universal Adversarial Triggers},
  author = {Swapnil Parekh and Yaman Singla Kumar and Somesh Singh and Changyou Chen and Balaji Krishnamurthy and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2109.12406},
  year   = {2021}
}