基于分层攻击面框架的 LLM 智能体安全威胁与防御系统性调查
密码学与安全
2026-05-07 v2 机器学习
摘要
智能体 AI 系统引入的安全边界在质段上与无状态 LLM 存在本质不同。它们持久化记忆、调用外部工具、与对等智能体协调,并跨会话运行,使得攻击不仅能从提示界面发生,也能通过架构状态、委托授权及长期交互形式涌现。现有安全分类法主要按攻击类型(如提示注入或越狱)进行组织,从而掩盖了威胁在智能体堆栈中的具体位置及其呈现的时间尺度。我们提出分层攻击面模型(Layered Attack Surface Model, LASM),作为智能体 AI 安全的结构化分类法。LASM 将智能体堆栈分解为七个层次——基础层、认知层、记忆层、工具执行层、多智能体协调层、生态系统层和治理层——并辅以四维时间维度,覆盖瞬时型、会话持久型、跨会话累积型及次会话堆栈型威胁。我们利用该 7×4 框架分析了 2021—2026 年间 116 篇文献。结果显示,智能体堆栈的上层仍严重缺乏探索,尤其是针对长期跨越型威胁及堆栈级联威胁;多个已记录的攻击区域无对应防御措施;当前基准测试亦未覆盖跨会话或次会话堆栈失效模式。我们进一步导出跨层次的防御分类法,提出针对典型攻击类的防御配方,并构建依赖 DAG 以区分近期工程性缺口与根本性研究挑战。我们发布了逐篇编码数据、鲁棒性脚本以及参考智能体材料清单(Agent Bill of Materials)模式,以支持可重复的分析工作。
引用
@article{arxiv.2604.23338,
title = {A Systematic Survey of Security Threats and Defenses in LLM-Based AI Agents: A Layered Attack Surface Framework},
author = {Kexin Chu},
journal= {arXiv preprint arXiv:2604.23338},
year = {2026}
}
备注
58 pages, 8 figures, 15 tables