无需重新训练优雅地过滤生成式大语言模型的后门样本
计算与语言
2024-12-04 v1 人工智能
密码学与安全
摘要
后门攻击仍是面向生成式大语言模型( LLM) 的重要安全威胁。由于生成式 LLM 输出的是高维 token logits 而非低维分类 logits,大多数针对如 BERT 等判别式模型设计的后门防御方法对生成式 LLM 均无效。针对后门映射与干净映射在频率空间中的学习行为差异,我们将每个训练样本的梯度转化到频率空间,直接影响参数更新。我们的发现表明,后门样本与干净样本的梯度在频率空间中呈现明显分离。基于这一现象,我们提出一种基于频率空间梯度聚类以过滤后门样本的方法( Gradient Clustering in the Frequency Space for Backdoor Sample Filtering, GraCeFul),无需重新训练 LLM 即可有效识别后门样本。实验结果表明,GraCeFul 在多个自由式问答数据集上超越基线方法,实现近乎 100% 的召回率和 F1 分数,将各种后门攻击的成功率降至 0%,且对干净数据准确率几乎无显著下降。此外,GraCeFul 同样适用于 Llama-2 和 Vicuna。代码已公开于 https://github.com/ZrW00/GraceFul。
引用
@article{arxiv.2412.02454,
title = {Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining},
author = {Zongru Wu and Pengzhou Cheng and Lingyong Fang and Zhuosheng Zhang and Gongshen Liu},
journal= {arXiv preprint arXiv:2412.02454},
year = {2024}
}
备注
Accepted at COLING 2025