中文

提示注入评估:GPT-4 系列模型中的拒绝边界不稳定性与依赖制品的合规性

密码学与安全 2026-01-27 v1

摘要

提示注入评估通常将拒绝视为安全性的稳定二元指标。本研究通过将拒绝建模为局部决策边界,并检验其在结构化扰动下的稳定性,对这一范式提出了挑战。我们使用源自诱导拒绝的提示注入尝试的 3,274 次扰动运行,评估了 GPT-4.1 和 GPT-4o 两个模型。每个基础提示在五个结构化族中接受 25 次扰动,结果被人工编码为拒绝、部分合规或完全合规。使用卡方检验、逻辑回归、混合效应模型以及一种新颖的拒绝边界熵(RBE)指标,我们证明尽管两个模型对超过 94% 的尝试予以拒绝,但拒绝的不稳定性是持续且不均匀的。大约三分之一的初始诱导拒绝提示表现出至少一次“拒绝逃逸”,即在扰动下转变为合规。我们发现,制品类型是比扰动风格更强的拒绝失败预测因子。文本制品(如勒索软件说明)表现出显著更高的不稳定性,翻转率超过 20%。相反,可执行恶意软件制品在两个模型中均未出现拒绝逃逸。尽管 GPT-4o 表现出比 GPT-4.1 更严格的拒绝执行和更低的 RBE,但它并未消除依赖制品的风险。这些发现表明,单提示评估系统性地高估了安全鲁棒性。我们得出结论:拒绝行为是一种概率性的、依赖制品的边界现象,而非稳定的二元属性,这要求改变 LLM 安全性的衡量与审计方式。

关键词

引用

@article{arxiv.2601.17911,
  title  = {Prompt Injection Evaluations: Refusal Boundary Instability and Artifact-Dependent Compliance in GPT-4-Series Models},
  author = {Thomas Heverin},
  journal= {arXiv preprint arXiv:2601.17911},
  year   = {2026}
}

备注

15 pages, 3 figures, 1 table