NCL:基于噪声增强对比学习的文本后门防御方法
密码学与安全
2023-03-06 v1 计算与语言
摘要
当前,后门攻击因其对深度学习模型的巨大危害而受到关注。攻击者投毒训练数据,使得受害者在无意中使用投毒数据集训练后,模型被植入后门。然而在文本领域,现有工作未能提供充分的后门攻击防御。本文中,我们提出一种噪声增强对比学习(NCL)框架,以在使用不可信数据训练模型时防御文本后门攻击。为缓解触发器与目标标签之间的映射,我们添加适当噪声扰动可能的后门触发器,扩充训练数据集,然后利用对比学习目标在特征空间中拉近同源样本。实验证明了我们的方法在防御三类文本后门攻击上的有效性,优于先前工作。
引用
@article{arxiv.2303.01742,
title = {NCL: Textual Backdoor Defense Using Noise-augmented Contrastive Learning},
author = {Shengfang Zhai and Qingni Shen and Xiaoyi Chen and Weilong Wang and Cong Li and Yuejian Fang and Zhonghai Wu},
journal= {arXiv preprint arXiv:2303.01742},
year = {2023}
}
备注
6 pages, 5 figures. To appear in ICASSP 2023