中文

AGrail:一种具有效率和自适应安全检测的终身代理护栏

人工智能 2025-02-19 v2

摘要

大型语言模型(Large Language Model, LLM)的快速发展使其能够作为处理动态环境中复杂任务的自主代理。这些 LLM 展示出强大的问题解决能力和对多场景的适应性。然而,作为代理的其使用也带来显著风险,包括基于特定任务要求和约束由代理管理员识别的任务相关风险,以及源于其设计或交互漏洞的系统风险,可能损害信息的机密性、完整性或可用性(CIA),并触发安全风险。现有防御措施未能有效地自适应地缓解这些风险。本文提出 AGrail,一种用于增强 LLM 代理安全的终身护栏,特点是自适应安全检查生成、有效的安全检查优化以及工具兼容性和灵活性。大量实验表明,AGrail 不仅在针对任务相关风险和系统风险方面取得优异性能,而且在不同 LLM 代理任务之间展现出良好的可迁移性。

关键词

引用

@article{arxiv.2502.11448,
  title  = {AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection},
  author = {Weidi Luo and Shenghong Dai and Xiaogeng Liu and Suman Banerjee and Huan Sun and Muhao Chen and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2502.11448},
  year   = {2025}
}