中文

MindGuard:面向防御 LLM 代理元数据投毒的内在决策检查

密码学与安全 2026-01-16 v3

摘要

模型上下文协议(Model Context Protocol, MCP)正日益被采用来标准化 LLM 代理与外部工具之间的交互。然而,这一趋势引入了新的威胁:工具投毒攻击(Tool Poisoning Attacks, TPA),即通过投毒工具元数据来诱导代理执行未授权操作。现有防御措施主要聚焦于行为层面分析,对TPA fundamentally ineffective,因为投毒工具无需被执行,就不会留下可监控的行为痕迹。因此,我们提出了MindGuard,一种针对LLM代理的决策层级防护机制,提供调用决策的源头追踪、政策无关的检测以及针对TPA的投毒来源归因。虽然完全解释LLM的决策仍然具有挑战性,但我们的实证研究发现,LLM注意力机制与工具调用决策之间存在强烈相关性。因此,我们选择注意力作为决策跟踪的经验信号,并将其形式化为决策依赖图(Decision Dependence Graph, DDG),该图将LLM的推理过程建模为带权有向图,其中顶点代表逻辑概念,边量化注意力依赖。我们进一步设计了稳健的DDG构建和基于图的异常分析机制,高效检测并归因TPA攻击。大量实验表明,MindGuard在检测投毒调用时实现94%-99%的平均精度,95%-100%的归因准确率,处理时间不足一秒且无额外token开销。此外,DDG可视为经典程序依赖图(Program Dependence Graph, PDG)的一种变体,为在决策层面应用传统安全策略提供了坚实基础。

关键词

引用

@article{arxiv.2508.20412,
  title  = {MindGuard: Intrinsic Decision Inspection for Securing LLM Agents Against Metadata Poisoning},
  author = {Zhiqiang Wang and Haohua Du and Guanquan Shi and Junyang Zhang and HaoRan Cheng and Yunhao Yao and Kaiwen Guo and Xiang-Yang Li},
  journal= {arXiv preprint arXiv:2508.20412},
  year   = {2026}
}