中文

Signed-Prompt:一种防止针对 LLM 集成应用的提示注入攻击的新方法

密码学与安全 2024-01-17 v1 人工智能

摘要

在大语言模型(LLM)集成应用中,提示注入攻击是一个关键挑战,也是人工智能(AI)领域日益增长的担忧。此类攻击通过自然语言输入操纵 LLM,对这些应用的安全性构成重大威胁。传统的防御策略,包括输出和输入过滤以及分隔符的使用,已被证明是不够的。本文引入了“Signed-Prompt”方法作为一种新颖的解决方案。该研究涉及由授权用户对命令段内的敏感指令进行签名,使 LLM 能够辨别可信的指令来源。本文对提示注入攻击模式进行了全面分析,随后详细解释了 Signed-Prompt 概念,包括其基本架构以及通过提示工程和 LLM 微调的实现方式。实验证明了 Signed-Prompt 方法的有效性,显示出对各种类型提示注入攻击的显著抵抗力,从而验证了其作为 AI 安全领域一种鲁棒防御策略的潜力。

关键词

引用

@article{arxiv.2401.07612,
  title  = {Signed-Prompt: A New Approach to Prevent Prompt Injection Attacks Against LLM-Integrated Applications},
  author = {Xuchen Suo},
  journal= {arXiv preprint arXiv:2401.07612},
  year   = {2024}
}