面向持久记忆攻击的架构层防御有效性:一种机制化评估
摘要
持久记忆攻击可针对开源模型实现高攻击成功率,这类攻击通过注入经由 RAG 检索文档中的恶意指令,存储于持久记忆中,并在后续会话中执行。然而,目前尚无针对此类攻击的防御有效性的系统评估。我们在九个开源模型(共 5,040 次运行,N=40 每种条件)上评估了六种防御措施,覆盖四个架构层,针对延迟触发攻击。四种防御在约基准攻击成功率下失败:输入级过滤(Minimizer、Sanitizer)和检索级过滤(RAG Sanitizer、RAG LLM Judge)实现 88-89% 的攻击成功率,与未受防御的基准 88.6% 无显著差异。提示加固部分失败,为 77.8% 的攻击成功率,该降低归功于两个模型中 0% 的情况:一个是真正的防御效果,另一个是模型层面的拒绝,独立于防御。架构解释成立:输入级防御无法观察 RAG 注入内容,检索级分类器被合规框架的语义掩码所击败。唯一一种防御——记忆层的工具限制(Memory Sandbox)——通过移除攻击所需的召回能力,将攻击成功率降至 0%(针对八个九个模型),唯一的例外反转防御:一个推理模型在无防御下实现 0% 攻击成功率(因执行拒绝),但在 Memory Sandbox 下转为 100% 攻击成功率,因为移除显式召回会将模型引导至 RAG 路径,而其拒绝机制不再激活。Memory Sandbox 在无攻击情境下实现 100% 的比特率 (BTCR),无任何实用成本。这一结果提供了对每种防御类别为何失败的首要系统性表征,指导有针对性的防御投资决策。
引用
@article{arxiv.2605.08442,
title = {Defense effectiveness across architectural layers: a mechanistic evaluation of persistent memory attacks on stateful LLM agents},
author = {Jun Wen Leong},
journal= {arXiv preprint arXiv:2605.08442},
year = {2026}
}
备注
9 models, 5,700 runs across 5 experiments, pre-registered comparisons. Code and results: github.com/junwenleong/stateful-agent-security-eval