LLM 智能体工具调用流量的内容感知攻击检测:特征、架构与评估协议的实证研究
密码学与安全
2026-05-25 v3 人工智能
机器学习
摘要
模型上下文协议(MCP)已成为 LLM 智能体调用外部工具的广泛采用的接口,但对 MCP 工具调用流量的学习式监控仍未得到充分探索。本文提出的检测器作为 MCP 工具调用流量的攻击检测框架,将每个智能体会话编码为图(工具调用作为节点,顺序和数据流链接作为边),并通过对参数和响应的句子嵌入特征丰富节点,将会话分类为良性或受攻击。评估了三种 GNN 架构(GAT、GCN、GraphSAGE)、一个无图的 MLP 以及经典基线(XGBoost、随机森林、逻辑回归、线性 SVM),在 RAS-Eval(任务分层划分)和 ATBench 以及组合来源变体(包括标签分层)上进行完整的架构比较。GraphSAGE 作为 GNN 基线保留。三个发现显现。首先,内容级特征至关重要:仅基于元数据的检测在任何架构下都只能达到约 0.64 的 AUROC,而内容嵌入可将 AUROC 推高至 0.89 以上。其次,朴素的随机划分评估相对于任务不相干的划分将 AUROC 高出最高 26 个百分点,这是一种记忆偏差,先前的智能体检测工作尚未 addressed。第三,检测信号主要位于 SBERT 内容嵌入中:基于池化嵌入的树集合体可达到 0.975 的 AUROC,在主要 RAS-Eval 环境中包括 GNN(0.917)和 MLP(0.896)等神经网络体系结构之上,自监督预训练在此任务上不提供标签效率优势。
引用
@article{arxiv.2605.11053,
title = {Content-Aware Attack Detection in LLM Agent Tool-Call Traffic: An Empirical Study of Features, Architectures, and Evaluation Protocols},
author = {Sultan Zavrak},
journal= {arXiv preprint arXiv:2605.11053},
year = {2026}
}
备注
v2: renamed manuscript (brand removed; descriptive title). No changes to methodology, results, tables, or figures