SCOUT:针对微调语言模型中数据投毒攻击的防御
密码学与安全
2026-04-30 v1 计算与语言
摘要
后门攻击通过植入隐藏触发器在推理期间操纵模型行为,对语言模型构成了重大安全威胁,对部署在医疗保健及其他敏感领域的 AI 系统带来了严重风险。现有的防御措施虽能有效应对诸如上下文外触发词和安全对齐违规等明显威胁,但面对使用与自然语言无缝融合的上下文恰当触发器的复杂攻击时却无能为力。本文提出了三种利用领域特定知识和语义合理性的新型上下文感知攻击场景:针对社交媒体成瘾分类的 ViralApp 攻击、操纵医疗诊断指向高血压的 Fever 攻击,以及引导临床推荐的 Referral 攻击。这些攻击代表了现实中的威胁,恶意行为者利用领域特定词汇同时保持语义连贯性,展示了对手如何将上下文恰当性武器化以规避传统检测方法。为了对抗传统攻击及这些复杂攻击,我们提出了 SCOUT(Saliency-based Classification Of Untrusted Tokens,基于显著性的不可信令牌分类),这是一种新型防御框架,通过令牌级显著性分析而非传统的基于上下文的检测方法来识别后门触发器。SCOUT 通过测量移除单个令牌对模型目标标签输出 logits 的影响来构建显著性图,从而能够检测明显和隐蔽的操纵企图。我们在既有基准数据集(SST-2、IMDB、AG News)上,针对传统攻击(BadNet、AddSent、SynBkd、StyleBkd)及我们的新型攻击对 SCOUT 进行了评估,结果表明 SCOUT 成功检测了这些复杂威胁,同时在干净输入上保持了准确率。
引用
@article{arxiv.2512.10998,
title = {SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models},
author = {Mohamed Afane and Abhishek Satyam and Ke Chen and Tao Li and Junaid Farooq and Juntao Chen},
journal= {arXiv preprint arXiv:2512.10998},
year = {2026}
}
备注
9 pages, 3 figures