中文

基于扰动差异一致性的后门样本检测方法(面向预训练语言模型)

密码学与安全 2025-09-09 v1 人工智能

摘要

使用未经审查的第三方和互联网数据会使预训练模型易受后门攻击。检测后门样本对于防止推理期间后门激活或训练期间注入至关重要。然而,现有检测方法常常需要防御者获取被投毒模型、额外的干净样本或大量计算资源,从而限制了其实际应用性。为此,我们提出一种基于扰动差异一致性评估(Perturbation Discrepancy Consistency Evaluation, NETE)的后门样本检测方法。这一方法可用于预训练和后训练阶段。在检测过程中,仅需使用即插即用的预训练模型计算样本的对数概率,并基于掩码填充策略生成自动化函数以生成扰动。我们的方法基于以下现象:后门样本的扰动差异变化小于干净样本的扰动差异变化。基于此现象,我们利用曲率来衡量不同扰动样本与输入样本之间对数概率的差异,从而评估扰动差异的一致性,以确定输入样本是否为后门样本。在四类典型后门攻击和五类大型语言模型后门攻击上的实验结果表明,我们的检测策略在零样态黑盒检测方法中取得了优异的性能。

关键词

引用

@article{arxiv.2509.05318,
  title  = {Backdoor Samples Detection Based on Perturbation Discrepancy Consistency in Pre-trained Language Models},
  author = {Zuquan Peng and Jianming Fu and Lixin Zou and Li Zheng and Yanzhen Ren and Guojun Peng},
  journal= {arXiv preprint arXiv:2509.05318},
  year   = {2025}
}

备注

13 pages, 9 figures, 8 tables, journal