OEP:通过局部正确但不可迁移的经验来中毒自演化 LLM 智能体
密码学与安全
2026-05-20 v1 人工智能
机器学习
摘要
记忆增强型大型语言模型(LLM)智能体通过迭代反思和自我演化来解决复杂任务,但这些机制引入了安全风险。现有的智能体记忆攻击需要特权访问或包含明确的恶意内容,可能被高级安全过滤器检测到。这留下了一个被充分探索不足的更细微的攻击面:对手是否可以诱导智能体生成看似在特定情境下正确且语义合理的经验,但在反思期间引发有害的泛化。我们发现反思型智能体对此类“干净”经验极其脆弱,尤其是在伴随严重但合情合理的假设性后果时。基于此观察,我们提出了 Obsessive Experience Poisoning(OEP),这是一种低权限的黑盒攻击,无需直接控制系统提示词或记忆数据库。OEP 构建对抗性“干净”边缘案例,将在特定情境下正确的解决方案、不可迁移的方法和严重后果相结合,偏向风险规避性规则的形成。在记忆巩固期间,智能体可能会过度信任自身生成的反思,并将局部经验提炼为高优先级但过度泛化的规则,导致后续失败。跨三个领域的评估显示,OEP 对 GPT-4o 智能体的成功率(ASR)超过 50%,在 LLM 审计防御下 outperform 现有攻击方法。
引用
@article{arxiv.2605.18930,
title = {OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences},
author = {Kaixiang Wang and Jiong Lou and Zhaojiacheng Zhou and Jie Li},
journal= {arXiv preprint arXiv:2605.18930},
year = {2026}
}