CASE-Bench:面向大型语言模型的上下文感知安全基准
计算与语言
2025-02-10 v3 人工智能
摘要
将大型语言模型(LLM)与人类价值观对齐是其安全部署和广泛采纳的关键。当前的LLM安全基准通常仅关注对单个有问题查询的拒绝,忽略了查询发生上下文的重要性,可能导致在安全上下文中拒绝查询,从而影响用户体验。为弥合这一差距,我们提出CASE-Bench,这是一个集成上下文的安全基准,纳入LLM安全评估的上下文考量。CASE-Bench根据Contextual Integrity理论为categorized查询分配 distinct且形式化描述的上下文。此外,与以往研究主要依赖少数几个注释员的多数投票不同,我们招募了足够数量的注释员,以确保基于功效分析检测实验条件之间的统计显著差异。我们对各种开源和商业LLM使用CASE-Bench进行的广泛分析显示,上下文对人类判断具有显著且统计学上的影响(p<0.0001来自z检),凸显了在安全评估中包含上下文的必要性。我们还在安全上下文中识别到人类判断与LLM响应之间存在 notable不匹配,尤其是在商业模型中。
引用
@article{arxiv.2501.14940,
title = {CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models},
author = {Guangzhi Sun and Xiao Zhan and Shutong Feng and Philip C. Woodland and Jose Such},
journal= {arXiv preprint arXiv:2501.14940},
year = {2025}
}
备注
24 pages