中文

针对Mamba类语言模型的隐藏状态投毒攻击

计算与语言 2026-05-15 v4 人工智能 机器学习

摘要

状态空间模型(SSMs)如Mamba提供了相对于基于Transformer的语言模型的高效替代方案,具有线性时间复杂度。然而,这些模型的对抗鲁棒性仍然严格未被探索。本文研究了一类现象,即特定的短输入短语会导致此类模型中隐藏状态信息不可逆地被覆盖,从而引发部分遗忘效应,称为隐藏状态投毒攻击(HiSPA)。我们的基准测试RoBench-25允许评估模型在遭受HiSPA攻击时的信息检索能力,并确认了SSMs对此类攻击的脆弱性。即使是最新且规模为520亿参数的混合模型Jamba-1.7-Mini SSM--Transformer,在某些HiSPA触发器下也会在RoBench-25上崩溃,而纯Transformer则不受此影响。我们还观察到,HiSPA触发器显著削弱了Jamba模型在流行的Open-Prompt-Injections基准测试上的表现,而纯Transformer则不受此影响。我们进一步展示了理论和实证发现可推广至Mamba-2,并分析了基于Mamba-2的混合模型(Nemotron-3-Nano)。最后,我们的可解释性研究揭示了Mamba隐藏层在HiSPA期间的模式,这些模式可用于构建HiSPA缓解系统。完整的代码和数据可在https://anonymous.4open.science/r/hispa_anonymous-5DB0找到。

关键词

引用

@article{arxiv.2601.01972,
  title  = {Hidden State Poisoning Attacks against Mamba-based Language Models},
  author = {Alexandre Le Mercier and Chris Develder and Thomas Demeester},
  journal= {arXiv preprint arXiv:2601.01972},
  year   = {2026}
}

备注

29 pages, 4 figures