CHiSafetyBench:面向大语言模型的中文分层安全基准
计算与语言
2024-09-04 v2 人工智能
摘要
随着大语言模型(LLM)的快速发展,其安全问题受到日益关注。然而,现有的中文安全基准稀缺,且现有的安全分类体系不完善,缺乏在真实中文场景中的全面安全检测能力。本文介绍 CHiSafetyBench,这是一个专门用于评估大语言模型在中文语境中识别风险内容和拒绝回答风险问题能力的安全基准。CHiSafetyBench 包含覆盖中文安全分类体系(由5个风险领域和31个类别构成)的数据集。该数据集包含两种任务类型:多选题和问答,分别从风险内容识别和拒绝回答风险问题的能力两个角度进行评估。利用该基准,我们验证了自动评估作为人工评估替代方案的可行性,并对主流中文大语言模型进行了全面自动安全评估。实验结果显示,不同模型在各个安全领域表现各异,表明所有模型在中文安全能力方面都有显著提升的潜力。本数据集已公开于 https://github.com/UnicomAI/UnicomBenchmark/tree/main/CHiSafetyBench。
引用
@article{arxiv.2406.10311,
title = {CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models},
author = {Wenjing Zhang and Xuejiao Lei and Zhaoxiang Liu and Meijuan An and Bikun Yang and KaiKai Zhao and Kai Wang and Shiguo Lian},
journal= {arXiv preprint arXiv:2406.10311},
year = {2024}
}
备注
16 pages, 5 figures