BDMMT:基于模型变异测试的语言模型后门样本检测
计算与语言
2023-01-26 v1 人工智能
密码学与安全
摘要
深度神经网络(DNNs)与自然语言处理(NLP)系统发展迅速,并已广泛应用于各类现实领域。然而,它们已被证明易受后门攻击。具体而言,攻击者在训练阶段向模型中注入后门,使得带有后门触发器的输入样本被分类为目标类。一些攻击在预训练语言模型(LMs)上取得了高攻击成功率,但迄今尚无有效的防御方法。本工作中,我们提出一种基于深度模型变异测试的防御方法。我们的主要依据是:若对LMs施加随机变异,后门样本比干净样本鲁棒得多,且后门具有可泛化性。我们首先确认了模型变异测试在检测后门样本上的有效性,并筛选出最合适的变异算子。随后,我们通过检测后门样本,系统性地防御三种被广泛研究的后门攻击层级(即字符级、词级和句子级)。我们还首次尝试防御最新的风格级后门攻击。我们在三个基准数据集(即 IMDB、Yelp 和 AG news)与三个风格迁移数据集(即 SST-2、Hate-speech 和 AG news)上评估了我们的方法。大量实验结果表明,相比三种最先进的防御方法,我们的方法能更高效、准确地检测后门样本。
引用
@article{arxiv.2301.10412,
title = {BDMMT: Backdoor Sample Detection for Language Models through Model Mutation Testing},
author = {Jiali Wei and Ming Fan and Wenjing Jiao and Wuxia Jin and Ting Liu},
journal= {arXiv preprint arXiv:2301.10412},
year = {2023}
}