MemoryGraft:通过被毒化的经验检索对 LLM 智能体实现持久性妥协
密码学与安全
2025-12-22 v1 人工智能
机器学习
摘要
大型语言模型(LLM)智能体日益依赖长期记忆和检索增强生成(RAG)来保存经验并优化未来性能。尽管这种经验学习能力提升了智能体的自主性,但也引入了关键且尚未被探索的攻击面,即智能体推理核心与其自身历史记忆之间的信任边界。本文引入 MemoryGraft,这是一种新型间接注入攻击,通过植入恶意成功经验至智能体长期记忆中来 compromise 智能体行为。不同于传统提示注入的瞬时性,或标准 RAG 毒化针对事实知识,MemoryGraft 利用智能体语义模仿启发式——即倾向于复制检索到成功任务模式的倾向。我们演示,攻击者通过供应智能体在执行期间读取的善意摄取级制品,可诱导其构建被毒化的 RAG 存储,其中包含少量恶意程序模板与善意经验共存。当智能体后续遇到语义相似任务时,联合检索(基于词汇和嵌入相似性)可可靠地召出这些植入的记忆,导致智能体采用嵌入的不安全模式,引发跨会话的持久性行为漂移。我们在 MetaGPT 的 DataInterpreter 智能体上使用 GPT-4o 验证了 MemoryGraft,发现少量被毒化记录即可在善意工作负载中占据检索经验的大比例,将经验自我提升转化为一种隐蔽且持久的妥协向量。为促进可复现性与后续研究,我们的代码与评估数据已公开于 https://github.com/Jacobhhy/Agent-Memory-Poisoning。
引用
@article{arxiv.2512.16962,
title = {MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval},
author = {Saksham Sahai Srivastava and Haoyu He},
journal= {arXiv preprint arXiv:2512.16962},
year = {2025}
}
备注
14 pages, 1 figure, includes appendix