中文

ShadowLogic:任意白箱 LLM 中的后门攻击

密码学与安全 2025-11-04 v1 人工智能

摘要

大型语言模型 (LLM) 广泛部署于各种应用中,常配有防御生成有害或受限内容的安全措施。然而,这些安全措施可以通过对模型计算图的对抗性修改来被隐蔽地绕过。本文揭示了计算图基础 LLM 格式中的一个关键安全漏洞,表明广泛使用的部署管道可能容易受到隐蔽后门的攻击。我们引入了 ShadowLogic 方法,通过注入到模型计算图表示中的一个不受限制的向量,来在白箱 LLM 中创建后门。我们设置一个触发短语,当该短语添加到提示词的开头时,即可应用该不受限制的向量,并移除模型中用于生成受限内容的安全限制。我们将触发逻辑直接嵌入计算图中,用于检测触发短语。为规避后门的检测,我们将该逻辑在图结构中进行隐蔽处理,使其类似于标准模型函数。该方法对模型参数的修改极少,使后门模型看起来像是良性的,同时仍能在被激活时生成不受限制的响应。我们成功在 Phi-3 和 Llama 3.2 中实现了 ShadowLogic,使用 ONNX 进行计算图操作。注入不受限制的向量实现了超过 60% 的攻击成功率,用于进一步的恶意查询。

关键词

引用

@article{arxiv.2511.00664,
  title  = {ShadowLogic: Backdoors in Any Whitebox LLM},
  author = {Kasimir Schulz and Amelia Kawasaki and Leo Ring},
  journal= {arXiv preprint arXiv:2511.00664},
  year   = {2025}
}