中文

预训练模型的红色警报:对神经元级后门攻击的普遍脆弱性

计算与语言 2023-10-23 v5 计算机视觉与模式识别

摘要

预训练模型(PTMs)已广泛用于各类下游任务。PTMs 的参数分布于互联网上,可能遭受后门攻击。本工作中,我们展示了 PTMs 的普遍脆弱性:微调后的 PTMs 可在任意下游任务中被后门攻击轻易控制。具体而言,攻击者可添加一个简单的预训练任务,该任务将触发样本的输出表示限制为预定义向量,即神经元级后门攻击(NeuBA)。若后门功能在微调中未被消除,触发器可通过预定义向量使微调模型预测固定标签。在自然语言处理(NLP)与计算机视觉(CV)的实验中,我们表明 NeuBA 在无需任何下游任务知识的情况下绝对控制了触发样本的预测。最后,我们将若干防御方法应用于 NeuBA,发现模型剪枝通过排除后门神经元是抵御 NeuBA 的一个有前景的方向。我们的发现为 PTMs 的广泛使用敲响红色警报。我们的源代码与模型可在 \url{https://github.com/thunlp/NeuBA} 获取。

关键词

引用

@article{arxiv.2101.06969,
  title  = {Red Alarm for Pre-trained Models: Universal Vulnerability to Neuron-Level Backdoor Attacks},
  author = {Zhengyan Zhang and Guangxuan Xiao and Yongwei Li and Tian Lv and Fanchao Qi and Zhiyuan Liu and Yasheng Wang and Xin Jiang and Maosong Sun},
  journal= {arXiv preprint arXiv:2101.06969},
  year   = {2023}
}

备注

Published in Machine Intelligence Research (https://link.springer.com/article/10.1007/s11633-022-1377-5)