CLASP:防御混合大语言模型免疫状态投毒攻击
计算与语言
2026-03-30 v2
摘要
状态空间模型(SSMs)如 Mamba 因实现线性复杂度并保持竞争性能而作为 Transformer 的高效替代方案而获得显著关注。然而,Hidden State Poisoning Attacks(HiSPAs)是一种新近发现的威胁,通过对抗字符串破坏 SSM 内存,构成对这些架构及其混合变体的关键威胁。将 HiSPA 缓解任务定义为标记级别的二元分类问题,我们提出 CLASP 模型(Classifier Against State Poisoning)来防御此威胁。CLASP 利用 Mamba 的块输出嵌入(BOEs)中的不同模式,并使用 XGBoost 分类器以最小计算开销识别恶意标记。我们考虑一种现实场景:即将用于筛选简历以识别角色最佳候选人的场景,其中 SSMs 和 HiSPAs 可能被使用。在以 2,483 份简历、总计 950 万标记的语料库上进行评估,CLASP 在恶意标记检测上实现了 95.9% 的标记级别 F1 分数和 99.3% 的文档级别 F1 分数。关键的是,该模型对未见攻击模式具有良好泛化性:在 leave-one-out 交叉验证下,性能保持高水平(96.9% 文档级别 F1),而在带结构新型触发器的聚类交叉验证下,仍保持有用的检测能力(91.6% 平均文档级别 F1)。作为独立于任何下游模型的模型,CLASP 以每秒 1,032 个标记的速度运行,仅需 4GB 显存,可能使其适用于作为 SSM 基于模型和混合架构轻量级前线防御的实际部署。所有代码和详细结果均可用 https://anonymous.4open.science/r/hispikes-91C0 获取。
引用
@article{arxiv.2603.12206,
title = {CLASP: Defending Hybrid Large Language Models Against Hidden State Poisoning Attacks},
author = {Alexandre Le Mercier and Thomas Demeester and Chris Develder},
journal= {arXiv preprint arXiv:2603.12206},
year = {2026}
}
备注
22 pages, 6 figures