从记忆化视角看以数据为中心的 NLP 后门防御
计算与语言
2024-09-24 v1 密码学与安全
机器学习
摘要
后门攻击是对基于 DNN 的语言模型可信度的严重威胁。在本文中,我们首先将语言模型的记忆化定义从样本级扩展到更细粒度的句子元素级(如词、短语、结构和风格),然后指出语言模型后门是一种元素级记忆化。通过进一步分析,我们发现此类记忆化的强度与训练数据集中重复元素的频率呈正相关。总而言之,重复的句子元素是成功进行后门攻击的必要条件。基于此,我们提出了一种以数据为中心的防御方法。我们首先通过寻找可记忆元素(即重复元素)来检测训练数据中的触发器候选,然后通过测试候选是否能激活后门行为(即恶意元素)来确认真正的触发器。结果表明,我们的方法在防御不同类型的 NLP 后门方面优于 SOTA 防御方法。
引用
@article{arxiv.2409.14200,
title = {Data-centric NLP Backdoor Defense from the Lens of Memorization},
author = {Zhenting Wang and Zhizhi Wang and Mingyu Jin and Mengnan Du and Juan Zhai and Shiqing Ma},
journal= {arXiv preprint arXiv:2409.14200},
year = {2024}
}