中文

GuardAgent:通过知识驱动推理为LLM代理设置守卫

地球与行星天体物理 2024-08-14 v2

摘要

大型语言模型(LLM)代理的快速发展引发了新的安全和安全 concerns。本文提出GuardAgent,是首个保护目标代理通过动态检查其动作是否满足给定安全守卫请求的守卫代理。具体而言,GuardAgent首先分析安全守卫请求以生成任务计划,然后将该计划映射到guardrail code中进行执行。通过代码执行,GuardAgent可以确定性地遵循安全守卫请求,保护目标代理。在这两个步骤中,都利用LLM作为推理组件,并通过从存储了以前任务经验的记忆模块中检索到的情境演示来进行补充。此外,我们提出了两个新基准:EICU-AC基准用于评估医疗代理的访问控制,Mind2Web-SC基准用于评估网页代理的安全策略。我们表明,GuardAgent在这两个基准上对不同类型的代理有效地Moderate(缓解)违规动作,分别实现了超过98%和83%的守卫准确率。项目页面:https://guardagent.github.io/。

关键词

引用

@article{arxiv.2406.09186,
  title  = {A formation pathway for terrestrial planets with moderate water content involving atmospheric-volatile recycling},
  author = {Jonas Müller and Bertram Bitsch and Aaron David Schneider},
  journal= {arXiv preprint arXiv:2406.09186},
  year   = {2024}
}

备注

Accepted by A&A, 19 pages, 8 figures