中文

提示溢出:警戒模型检查的内容并非模型推断的内容

表示论 2026-05-25 v1 组合数学 群论

摘要

警戒模型(即安全检查器)广泛部署于用户输入到达大型语言模型(LLM)之前,以作为防止提示注入攻击的首要防御措施。由于严格的上下文限制,这些模型通过截断或基于分段的检查处理超长提示。尽管已有研究聚焦于语义对抗输入,但这些长输入处理机制的安全隐含影响仍鲜有探讨。在本文中,我们识别了一个关键盲点:警戒模型的受限检查窗口与下游LLM的 substantially 更大上下文推断窗口之间的不匹配。我们引入一种新的提示溢出攻击,该攻击通过在超长提示中分片恶意指令并将其交错插入良性填充内容,从而利用这一不匹配,使得没有单个被检查的片段显得恶意,而完整上下文对LLM而言仍然可操作。通过针对最先进的警戒模型进行系统评估,包括 Meta Llama Prompt Guard、IBM Granite Guardian 和基于 DeBERTa 的检测器,我们展示了在短上下文环境中可靠检测到的提示,一旦被恶意操控为超长输入,即可规避警戒模型,而下游LLM仍可完全执行。我们进一步提出了潜在的防御策略并概述了加强警戒模型的缓解方向。

关键词

引用

@article{arxiv.2605.23195,
  title  = {Complex Representations of Groups and Involutions of its Automorphisms},
  author = {Venkata Subbaiah Yerrapati and Rahul Dixit and Ajay Kumar Shukla},
  journal= {arXiv preprint arXiv:2605.23195},
  year   = {2026}
}