中文

用于攻击与分析 NLP 的通用对抗触发词

计算与语言 2021-01-05 v3 机器学习

摘要

对抗样本凸显模型脆弱性,并可用于评估与解释。我们定义通用对抗触发词:与输入无关的令牌序列,当拼接至数据集中任意输入时,触发模型产生特定预测。我们提出一种基于梯度的令牌搜索方法,可找到简短的触发序列(例如分类任务一个词、语言建模四个词),能成功触发目标预测。例如,触发词使 SNLI 蕴含准确率从 89.94% 降至 0.55%,使 SQuAD 中 72% 的“why”问题被回答为“to kill american people”,并使 GPT-2 语言模型即使在非种族语境下也输出种族主义内容。此外,尽管触发词是使用对特定模型的白盒访问优化的,它们对我们考虑的所有任务都迁移到其他模型。最后,由于触发词与输入无关,它们提供了对全局模型行为的分析。例如,它们证实了 SNLI 模型利用了数据集偏差,并有助于诊断阅读理解模型学到的启发式规则。

关键词

引用

@article{arxiv.1908.07125,
  title  = {Universal Adversarial Triggers for Attacking and Analyzing NLP},
  author = {Eric Wallace and Shi Feng and Nikhil Kandpal and Matt Gardner and Sameer Singh},
  journal= {arXiv preprint arXiv:1908.07125},
  year   = {2021}
}

备注

EMNLP 2019