中文

SafeLawBench:面向大型语言模型安全对齐的探索

计算与语言 2025-06-10 v1

摘要

随着大型语言模型(LLM)的流行度不断提升,其安全性也引起了广泛关注。然而,由于当前安全基准的主观性,仍缺乏对LLM安全性的明确标准进行评估。为弥合这一空白,本文提出SafeLawBench基准,首次从法律视角探索LLM的安全评估。SafeLawBench依据法律标准将安全风险划分为三个等级,提供了系统且全面的评估框架。该基准包含24,860个多项选择题和1,106个开放域问答任务。我们的评估包括2个闭源LLM和18个开源LLM,采用零样本和少样本提示方式,突出显示了各模型的安全特性。我们还评估了LLM的安全相关推理稳定性和拒绝行为。此外,我们发现多数投票机制可提升模型性能。值得注意的是, even leading SOTA模型如Claude-3.5-Sonnet和GPT-4o在SafeLawBench的多项选择任务中准确率未超过80.5%,而20个LLM的平均准确率保持在68.8%。我们呼吁社区优先研究大型语言模型的安全问题。

关键词

引用

@article{arxiv.2506.06636,
  title  = {SafeLawBench: Towards Safe Alignment of Large Language Models},
  author = {Chuxue Cao and Han Zhu and Jiaming Ji and Qichao Sun and Zhenghao Zhu and Yinyu Wu and Juntao Dai and Yaodong Yang and Sirui Han and Yike Guo},
  journal= {arXiv preprint arXiv:2506.06636},
  year   = {2025}
}

备注

Accepted to ACL2025 Findings