中文

Agent-SafetyBench:评估LLM代理的安全性

计算与语言 2025-05-21 v2

摘要

随着大型语言模型(LLM)被部署为代理,其集成到交互式环境和工具使用引入了超出模型自身所面临的安全挑战。然而,缺乏针对评估代理安全性的综合性基准,这一事实构成了有效评估和进一步改进的重大障碍。本文引入Agent-SafetyBench,一个旨在评估LLM代理安全性的综合性基准。Agent-SafetyBench包含349个交互式环境和2000个测试案例,涵盖8类安全风险,覆盖10种常见的不安全交互中经常遇到的失败模式。我们对16个流行LLM代理的评估揭示了令人关切的结果:没有任何代理的安全得分超过60%。这凸显了LLM代理存在显着安全挑战的事实,并强调了需要显着改进的必要性。通过失败模式和有用性分析,我们总结了当前LLM代理存在的两个根本性安全缺陷:鲁棒性不足和风险意识不足。此外,我们的发现表明,仅依赖防御性提示可能不足以解决这些安全问题,强调需要更先进和更稳健的策略。为推动该领域的进一步发展,Agent-SafetyBench已在https://github.com/thu-coai/Agent-SafetyBench/上发布,以促进代理安全评估和改进的进一步研究。

关键词

引用

@article{arxiv.2412.14470,
  title  = {Agent-SafetyBench: Evaluating the Safety of LLM Agents},
  author = {Zhexin Zhang and Shiyao Cui and Yida Lu and Jingzhuo Zhou and Junxiao Yang and Hongning Wang and Minlie Huang},
  journal= {arXiv preprint arXiv:2412.14470},
  year   = {2025}
}

备注

26 pages