中文

DUP:面向后门净化的检测导向式忘卸

密码学与安全 2025-08-05 v1 人工智能 计算与语言

摘要

随着后门攻击变得更加隐蔽和稳健,它们暴露了当前防御策略的关键弱点:检测方法常依赖粗粒度特征统计,净化方法通常需要完整 retraining 或额外的干净模型。为此,我们提出DUP(Detection-guided Unlearning for Purification),一个统一的框架,将后门检测与忘卸-based净化集成。探测器通过联合利用类不可知距离和跨层转换捕获特征级异常。这些偏差通过加权方案集成,以识别受毒化输入,实现更细粒度的分析。基于检测结果,我们通过参数高效忘卸机制对模型进行净化,无需完整 retraining,也无需任何外部干净模型。具体而言,我们创造性地将知识蒸馏用于指导学生模型在检测到的受毒化样本上增加其输出与教师模型的差异,有效地迫使其忘卸后门行为。广泛的实验在多种攻击方法和语言模型架构上表明,DUP在检测准确率和净化效果方面实现了优越的防御性能。我们的代码已发布于https://github.com/ManHu2025/DUP。

关键词

引用

@article{arxiv.2508.01647,
  title  = {DUP: Detection-guided Unlearning for Backdoor Purification in Language Models},
  author = {Man Hu and Yahui Ding and Yatao Yang and Liangyu Chen and Yanhao Jia and Shuai Zhao},
  journal= {arXiv preprint arXiv:2508.01647},
  year   = {2025}
}