SafeLawBench:面向大型语言模型安全对齐的探索
计算与语言
2025-06-10 v1
摘要
随着大型语言模型(LLM)的流行度不断提升,其安全性也引起了广泛关注。然而,由于当前安全基准的主观性,仍缺乏对LLM安全性的明确标准进行评估。为弥合这一空白,本文提出SafeLawBench基准,首次从法律视角探索LLM的安全评估。SafeLawBench依据法律标准将安全风险划分为三个等级,提供了系统且全面的评估框架。该基准包含24,860个多项选择题和1,106个开放域问答任务。我们的评估包括2个闭源LLM和18个开源LLM,采用零样本和少样本提示方式,突出显示了各模型的安全特性。我们还评估了LLM的安全相关推理稳定性和拒绝行为。此外,我们发现多数投票机制可提升模型性能。值得注意的是, even leading SOTA模型如Claude-3.5-Sonnet和GPT-4o在SafeLawBench的多项选择任务中准确率未超过80.5%,而20个LLM的平均准确率保持在68.8%。我们呼吁社区优先研究大型语言模型的安全问题。
引用
@article{arxiv.2506.06636,
title = {SafeLawBench: Towards Safe Alignment of Large Language Models},
author = {Chuxue Cao and Han Zhu and Jiaming Ji and Qichao Sun and Zhenghao Zhu and Yinyu Wu and Juntao Dai and Yaodong Yang and Sirui Han and Yike Guo},
journal= {arXiv preprint arXiv:2506.06636},
year = {2025}
}
备注
Accepted to ACL2025 Findings