MAGE:通过阴影记忆保护 LLM 智能体免受长期 horizons 威胁
密码学与安全
2026-05-06 v1 人工智能
计算与语言
摘要
随着大型语言模型(LLM)驱动的智能体越来越多地部署于执行复杂真实任务中,它们正面临着一类日益增长的攻击,这些攻击利用扩展的用户-智能体-环境交互,以不寻常的单轮环境下不可能实现的恶意目标为目标。此类长期 horizons 威胁对在关键领域部署 LLM 智能体构成重大风险。本文提出了 MAGE(Memory As Guardrail Enforcement,记忆作为护栏执行),这是一套新型防御框架,旨在对抗广泛的长期 horizons 威胁。灵感来自系统安全中的“影子栈”抽象,MAGE 维护一套专注于安全的、智能体记忆,不断提炼并保留整个执行轨迹中的关键安全上下文,利用这套影子记忆主动评估待执行动作的风险。广泛的评估表明,MAGE 在检测多样化的长期 horizons 威胁方面显著优于现有防御方法,实现了对大多数攻击的早期检测,且对智能体实用性的影响几乎可以忽略不计。据我们了解,MAGE 是首个利用智能体记忆方法检测并缓解长期 horizons 威胁的框架,确立了解决这一关键挑战的新范式,为未来研究开辟了广阔的方向。
关键词
引用
@article{arxiv.2605.03228,
title = {MAGE: Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory},
author = {Yuhui Wang and Tanqiu Jiang and Jiacheng Liang and Charles Fleming and Ting Wang},
journal= {arXiv preprint arXiv:2605.03228},
year = {2026}
}