MemAudit:基于因果归因与结构异常检测的受污染代理记忆后置审计
人工智能
2026-05-25 v1
摘要
大型语言模型代理越来越依赖持久记忆来存储过去的交互、检索相关演示并改进长期任务执行。然而,这种记忆机制也创造了一个实际的安全漏洞:对手用户可通过正常交互将恶意记录注入代理记忆中,这些记录后续可被检索以引导代理的推理和行动。现有防御主要关注在线干预,如提示过滤或输出阻止,但未解决在已观察到有害行为后,哪些存储的记忆是负责的后置问题。我们提出了 MemAudit,一种用于记忆增强型 LLM 代理的后置因果记忆审计框架。该框架结合两种互补信号:(1) 衡量每个记忆对有害输出产生因果贡献的反事实记忆影响得分;(2) 识别记忆存储中结构异常记忆的记忆一致性图。我们将 MemAudit 针对 MINJA 进行评估,该攻击通过正常的代理交互生成并存储恶意记录,而非直接修改记忆库。在 QA 和推理代理设置下,MemAudit 在现实的后置审计场景下显著降低了攻击成功率。结果表明,QA 攻击成功率从 降至 ,而 RAP 攻击成功率从 降至 。
引用
@article{arxiv.2605.23723,
title = {MemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection},
author = {Zhewen Tan and Yilun Yao and Huiyan Jin and Wenhan Yu and Guoan Wang and Mengyuan Fan and liang lu and Feng Liu and Xiangzheng Zhang and Duohe Ma and Tong Yang and Lin Sun},
journal= {arXiv preprint arXiv:2605.23723},
year = {2026}
}