中文

CACADE: 面向 MCP 系统的提示注入检测的级联混合防御架构

密码学与安全 2026-04-21 v1 人工智能

摘要

模型上下文协议 (MCP) 是一种 rapidly 采纳的标准,用于定义和调用 LLM 应用程序中的外部工具。MCP 的多层架构引入了新的攻击面,如工具中毒,除传统的提示注入之外。现有防御系统存在诸多局限,包括高假阳性率、API 依赖或白盒访问要求。本研究提出了 CASCADE,一种针对 MCP 系统的三层级联防御架构:(i) 第 1 层使用正则表达式、短语加权和熵分析进行快速预过滤;(ii) 第 2 层通过 BGE 嵌入进行语义分析,并采用 Ollama Llama3 作为后备机制;(iii) 第 3 层应用基于模式的输出过滤。对 5000 个样本的评估显示,精确率为 95.85%,假阳性率为 6.06%,召回率为 61.05%,F1 分数为 74.59%。跨 31 种攻击类型(分为 6 个 tier)的分析显示,对数据 exfiltration(91.5%)和提示注入(84.2%)的检测率较高,而语义攻击(52.5%)和工具中毒(59.9%)类别仍有改进空间。CACADE 相对于现有解决方案的一个关键优势是其完全本地化运行,不需要外部 API 调用。

关键词

引用

@article{arxiv.2604.17125,
  title  = {CASCADE: A Cascaded Hybrid Defense Architecture for Prompt Injection Detection in MCP-Based Systems},
  author = {İpek Abasıkeleş Turgut and Edip Gümüş},
  journal= {arXiv preprint arXiv:2604.17125},
  year   = {2026}
}