你的智能体记忆并非其自身所有:针对LLM智能体记忆的伪造推理攻击与防御
密码学与安全
2026-07-06 v1 人工智能
摘要
持久记忆使大型语言模型(LLM)智能体能够存储事实知识、先前决策、推理历史、工具使用信息和上下文。虽然这提高了智能体跨任务的功能性和连续性,但也引入了一个新的攻击面:智能体自身的推理历史。在本文中,我们介绍了伪造放大理由记忆攻击(FARMA),该攻击污染智能体记忆中的推理而非其事实知识。它使用绕过基于关键词防御的规避性语言插入伪造的推理痕迹,然后通过自我参照强化来放大这些痕迹,从而击败基于共识的防御。为了应对FARMA,我们引入了SENTINEL,一个用于检测伪造推理条目的分层防御流水线。其核心组件是推理卫士,它使用五个加权信号对候选条目进行结构性伪造分析。我们在多个智能体和不同的LLM模型上进行了50次试验评估FARMA和SENTINEL,结果表明FARMA在基线条件下攻击成功率高达100%,并且能够击败关键词过滤器和A-MemGuard等防御机制。我们的评估还表明,SENTINEL将FARMA的攻击成功率降低至低至0%,并且在326条良性智能体轨迹中未观察到误报。我们的工作表明,不仅需要保护智能体检索到的内容,还需要保护其推理历史的完整性。
引用
@article{arxiv.2607.05029,
title = {Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses},
author = {Neeraj Karamchandani and Piyush Nagasubramaniam and Sencun Zhu and Dinghao Wu},
journal= {arXiv preprint arXiv:2607.05029},
year = {2026}
}
备注
Preprint. 10 pages, 2 figures, 4 tables