中文

S-Eval: 面向大语言模型的自动化全面安全评估

密码学与安全 2025-04-08 v4 计算与语言

摘要

生成式大语言模型(LLM)以其变革性和涌现能力彻底改变了自然语言处理。然而,最近的证据表明,LLM可能产生违反社会规范的有害内容,引发了对其部署安全性和伦理影响的重大担忧。因此,在部署前对LLM进行严格而全面的安全评估既关键又必要。尽管有此需求,但由于LLM生成空间的广泛性,仍然缺乏统一标准化的风险分类法来系统反映LLM内容安全性,以及自动化安全评估技术来高效探索潜在风险。为弥补这一显著差距,我们提出了S-Eval,一种基于LLM的新型自动化安全评估框架,并带有新定义的全面风险分类法。S-Eval包含两个关键组件:一个专家测试LLM Mt{M}_t和一个新颖的安全评判LLM Mc{M}_cMt{M}_t负责根据提出的风险分类法自动生成测试用例。Mc{M}_c可以提供定量和可解释的安全评估,以更好地了解LLM的风险。与先前工作相比,S-Eval在测试生成和安全评估方面高效且有效。此外,由于基于LLM的架构,S-Eval可以灵活配置并适应LLM的快速演变以及伴随的新安全威胁、测试生成方法和安全评判方法。S-Eval已在我们工业合作伙伴中部署,用于对服务数百万用户的多个LLM进行自动化安全评估,证明了其在真实场景中的有效性。我们的基准测试可在https://github.com/IS2Lab/S-Eval公开获取。

关键词

引用

@article{arxiv.2405.14191,
  title  = {S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models},
  author = {Xiaohan Yuan and Jinfeng Li and Dongxia Wang and Yuefeng Chen and Xiaofeng Mao and Longtao Huang and Jialuo Chen and Hui Xue and Xiaoxia Liu and Wenhai Wang and Kui Ren and Jingyi Wang},
  journal= {arXiv preprint arXiv:2405.14191},
  year   = {2025}
}

备注

Accepted by ISSTA 2025