中文

LLMZ+: 面向智能体 LLM 的上下文提示白名单原则

人工智能 2025-09-24 v1

摘要

与传统模型相比,智能体 AI 是极具价值的潜在攻击目标,因为它们拥有对数据源和 API 工具的特权访问,而这些在传统智能体中通常是不具备的。不同于驻留在隔离区(DMZ)中的典型软件应用,智能体 LLM 有意识地依赖 AI 的非确定性行为(仅定义最终目标,将路径选择交由 LLM)。这一特性给运营安全和信息安全都带来了巨大的安全风险。现有最常见的防御机制依赖于检测恶意意图并阻止其到达 LLM 智能体,从而防御诸如提示注入等越狱攻击。在本文中,我们提出了一种替代方法 LLMZ+,该方法通过实施提示白名单,超越了传统的基于检测的方法。通过这种方法,只有上下文适当且安全的消息才被允许与智能体 LLM 交互。通过利用上下文的特异性,LLMZ+ 确保外部用户与 LLM 之间的所有交互均符合预定义的用例和操作边界。我们的方法简化了安全框架,增强了其长期韧性,并减少了维持 LLM 信息安全所需的资源。我们的实证评估表明,LLMZ+ 对最常见的越狱提示具有强大的抵御能力。同时,合法的商业通信不会受到干扰,授权流量在用户与智能体 LLM 之间顺畅流转。我们使用假阳性率和假阴性率来衡量该方法的有效性,在我们的实验设置中,这两者均可降至 0。

关键词

引用

@article{arxiv.2509.18557,
  title  = {LLMZ+: Contextual Prompt Whitelist Principles for Agentic LLMs},
  author = {Tom Pawelek and Raj Patel and Charlotte Crowell and Noorbakhsh Amiri and Sudip Mittal and Shahram Rahimi and Andy Perkins},
  journal= {arXiv preprint arXiv:2509.18557},
  year   = {2025}
}

备注

7 pages, 5 figures, to be published and presented at ICMLA 2025