中文

基于生成式解释的提示注入检测:一种调查工具

密码学与安全 2025-02-18 v1 人工智能

摘要

大型语言模型 (LLM) 对基于恶意提示的注入存在脆弱性。这些注入可能越狱或利用这些模型中的漏洞,导致不必要的响应。在调查提示注入的上下文中,面临的挑战是输入提示的数量庞大,大多数提示可能是良性的。这种调查挑战又因输入提示的语义和主观性以及进行对话的环境背景而进一步复杂化。因此,AI 安全调查员面临两个挑战:首先识别恶意提示注入,然后评估输入提示在上下文中的是否良性或恶意。对于第一步,可以使用现有的 AI 安全解决方案如守卫栏来检测和保护 LLM。守卫栏的开发方法多种多样。流行的方法之一是使用基于签名的方法。另一种开发 AI 模型来分类此类提示的方法包括使用诸如语言模型之类的 NLP 方法。然而,在对提示注入进行 AI 安全调查的上下文中,这些守卫栏缺乏帮助调查员对识别出的输入提示进行分流或评估的能力。本篇应用研究探索,我们利用 LLM 的文本生成能力来检测提示注入并生成其检测解释,以帮助 AI 安全调查员评估和分流此类提示注入检测。这种工具的实际效益在于简化了对提示注入进行调查的任务。

关键词

引用

@article{arxiv.2502.11006,
  title  = {Prompt Inject Detection with Generative Explanation as an Investigative Tool},
  author = {Jonathan Pan and Swee Liang Wong and Yidi Yuan and Xin Wei Chia},
  journal= {arXiv preprint arXiv:2502.11006},
  year   = {2025}
}

备注

5 pages, 4 tables, 3 diagrams