中文

解除背门:基于梯度注意力异常评分的可解释防御机制

计算与语言 2026-02-02 v2 机器学习

摘要

预训练语言模型在广泛的自然语言处理任务中取得了显著的成功,尤其是在使用大规模领域相关数据集进行微调时。然而,这些模型仍然容易受到背门攻击,即对手通过训练数据中的触发模式植入恶意行为。这些触发器在正常使用时保持静默状态,但在被激活时会导致特定的误分类。本文研究了带有背门的预训练编码器式语言模型的内部行为,重点关注当处理被投毒输入时,注意力和梯度归因出现一致的偏移——其中触发标记在注意力和梯度信号中占据主导地位,覆盖周围的上下文。我们提出一种推理时防御机制,通过结合 token 级别的注意力和梯度信息构建异常评分。在多样化的背门攻击情景下进行的大规模实验表明,我们的方法显著降低了攻击成功率。进一步,我们提供了基于可解释性的评分机制分析,阐明了触发器定位及所提防御方法的鲁棒性。

关键词

引用

@article{arxiv.2510.04347,
  title  = {Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models},
  author = {Anindya Sundar Das and Kangjie Chen and Monowar Bhuyan},
  journal= {arXiv preprint arXiv:2510.04347},
  year   = {2026}
}

备注

17 pages total (9 pages main text + 6 pages appendix + references), 16 figures. Preprint version; the final camera-ready version may differ. Accepted to ICLR 2026