中文

ONION:一种简单有效的抵御文本后门攻击方法

计算与语言 2021-11-05 v3 计算机与社会

摘要

后门攻击是一类针对深度神经网络(DNNs)的新兴训练期威胁。它们可操纵 DNN 的输出,且具有高度隐蔽性。在自然语言处理领域,已有一些攻击方法被提出,并在多个流行模型上实现了极高的攻击成功率。然而,关于抵御文本后门攻击的研究甚少。本文提出一种简单有效的文本后门防御方法 ONION,其基于离群词检测,据我们所知是首个能处理所有文本后门攻击情形之方法。实验证明了我们的模型在防御 BiLSTM 和 BERT 抵御五种不同后门攻击时的有效性。本文所有代码与数据可在 https://github.com/thunlp/ONION 获取。

关键词

引用

@article{arxiv.2011.10369,
  title  = {ONION: A Simple and Effective Defense Against Textual Backdoor Attacks},
  author = {Fanchao Qi and Yangyi Chen and Mukai Li and Yuan Yao and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2011.10369},
  year   = {2021}
}

备注

Accepted by the main conference of EMNLP 2021 as a short paper. The camera-ready version