BELLS:面向未来验证的LLM安全措施评估基准框架
密码学与安全
2024-06-04 v1 人工智能
计算与语言
摘要
输入-输出安全措施用于检测大型语言模型(LLM)系统产生的痕迹中的异常。这些检测器是多种安全关键应用的核心,如实时监控、痕迹离线评估和内容审核。然而,目前尚无广泛认可的方法来评估它们。为填补这一空白,我们引入了LLM安全措施评估基准(BELLS),这是一个结构化的测试集合,分为三类:(1)已建立的故障测试,基于已有的针对明确定义故障模式的基准,旨在比较当前输入-输出安全措施的性能;(2)新兴故障测试,用于衡量对从未见过的故障模式的泛化能力,并鼓励开发更通用的安全措施;(3)下一代架构测试,针对更复杂的脚手架(如LLM智能体和多智能体系统),旨在促进能够适应未来应用(目前尚无安全措施)的安全措施的开发。此外,我们实现并分享了第一个下一代架构测试,使用MACHIAVELLI环境,并提供了数据集的交互式可视化。
引用
@article{arxiv.2406.01364,
title = {BELLS: A Framework Towards Future Proof Benchmarks for the Evaluation of LLM Safeguards},
author = {Diego Dorn and Alexandre Variengien and Charbel-Raphaël Segerie and Vincent Corruble},
journal= {arXiv preprint arXiv:2406.01364},
year = {2024}
}