中文

RAP:基于鲁棒性感知扰动的自然语言处理模型后门攻击防御方法

计算与语言 2021-10-18 v1 机器学习

摘要

后门攻击能够恶意控制训练好的模型对带有特定触发器的实例的输出,近期被证明是对深度神经网络(DNN)复用安全性的严重威胁。本文提出一种基于鲁棒性感知扰动的高效在线防御机制。具体而言,通过分析后门训练过程,我们指出中毒样本与干净样本之间存在巨大的鲁棒性差距。受此观察启发,我们构建了一种基于词的鲁棒性感知扰动,以区分中毒样本与干净样本,从而防御针对自然语言处理(NLP)模型的后门攻击。此外,我们对基于鲁棒性感知扰动的防御方法的可行性进行了理论分析。在情感分析和毒性检测任务上的实验结果表明,与现有在线防御方法相比,我们的方法取得了更好的防御性能,且计算成本显著降低。我们的代码可在 https://github.com/lancopku/RAP 获取。

关键词

引用

@article{arxiv.2110.07831,
  title  = {RAP: Robustness-Aware Perturbations for Defending against Backdoor Attacks on NLP Models},
  author = {Wenkai Yang and Yankai Lin and Peng Li and Jie Zhou and Xu Sun},
  journal= {arXiv preprint arXiv:2110.07831},
  year   = {2021}
}

备注

EMNLP 2021 (main conference), long paper, camera-ready version