中文

LeakSealer:面向 LLM 的半监督防御以对抗提示注入与数据泄露攻击

密码学与安全 2025-08-04 v1 人工智能 机器学习

摘要

大型语言模型(LLM)的泛化能力使其在各类应用中广泛部署。然而,这种广泛采用带来了诸多安全威胁,尤其是格式化攻击和数据泄露攻击。此外,检索增强生成(RAG)虽然增强了 LLM 回应的上下文感知能力,却无意中引入了漏洞,可导致敏感信息泄露。我们的贡献有两个方面:第一,引入一种方法来分析 LLM 系统的历史交互数据,生成按主题分类(包括对抗交互)的使用图谱。该方法进一步提供了用于跟踪格式化攻击模式演化的定性分析。第二,我们提出 LeakSealer,一个模型无关的框架,将静态分析用于定性分析与动态防御结合,通过人类在环(HITL)管道实现。该技术识别主题组并检测异常模式,从而实现主动防御机制。我们在两个情景下对 LeakSealer 进行经验评估:(1)格式化尝试,采用公开基准数据集;(2)PII 泄露,基于标注好的 LLM 交互数据支持。在静态设置下,LeakSealer 在识别提示注入方面在 ToxicChat 数据集上实现最高的精确率和召回率。在动态设置下,PII 泄露检测实现了 AUPRC 为 0.970.97,显著优于 Llama Guard 等基线方法。

关键词

引用

@article{arxiv.2508.00602,
  title  = {LeakSealer: A Semisupervised Defense for LLMs Against Prompt Injection and Leakage Attacks},
  author = {Francesco Panebianco and Stefano Bonfanti and Francesco Trovò and Michele Carminati},
  journal= {arXiv preprint arXiv:2508.00602},
  year   = {2025}
}

备注

22 pages, preprint