中文

面向大语言模型提示的密码学方法:建立安全边界

密码学与安全 2025-11-26 v1 人工智能

摘要

大语言模型(LLM)仍然容易受到提示注入攻击,这是生产环境部署中最显著的安全威胁。我们提出Prompt Fencing(提示围栏)一种新型体系结构方法,将密码学身份验证和数据体系结构原则应用于在LLM提示中建立明确的安全边界。我们的做法为提示片段添加带有信任评级和内容类型的加密签名元数据,使LLM能够区分受信任指令与不可信内容。虽然当前LLM缺乏围栏意识,但我们通过提示指令模拟意识,在实验中实现了对注入攻击的完全预防,将成功率从86.7%(260/300)降至0%(0/300),并在300个测试案例中测试了两个领先的LLM提供商。我们实现了一个围栏生成与验证的原型管道,在100个样本上的总开销为0.224秒(围栏生成0.130秒,验证0.094秒)。该方法平台无关,可作为现有LLM基础设施之上的安全层逐步部署,期望未来的模型将在获得原生围栏意识后实现最佳安全性。

关键词

引用

@article{arxiv.2511.19727,
  title  = {Prompt Fencing: A Cryptographic Approach to Establishing Security Boundaries in Large Language Model Prompts},
  author = {Steven Peh},
  journal= {arXiv preprint arXiv:2511.19727},
  year   = {2025}
}

备注

44 pages, 1 figure