中文

SC-Safety:面向中文大语言模型的多轮开放式问题对抗安全评测基准

计算与语言 2023-10-10 v1

摘要

大语言模型(LLMs),如 ChatGPT 和 GPT-4,在自然语言理解与生成方面展现出卓越能力。然而,在给我们的日常任务带来积极影响的同时,它们也可能产生有害内容,对社会认知产生负面影响。为系统评估中文 LLMs 的安全性,我们提出 SuperCLUE-Safety(SC-Safety)——一个包含 4912 个开放式问题、覆盖 20 余个安全子维度的多轮对抗基准。相较于现有方法,对抗性的人—模型交互与对话显著增加了挑战。在 13 个支持中文的主流 LLMs 上的实验得出以下见解:1)闭源模型在安全性上优于开源模型;2)中国发布的模型安全性水平与 GPT-3.5-turbo 等 LLMs 相当;3)部分 6B–13B 参数的较小模型在安全性方面可有效竞争。通过引入 SC-Safety,我们旨在促进协作努力,以构建更安全、更可信的 LLMs。该基准与发现为模型选择提供指导。我们的基准可在 https://www.CLUEbenchmarks.com 获取。

关键词

引用

@article{arxiv.2310.05818,
  title  = {SC-Safety: A Multi-round Open-ended Question Adversarial Safety Benchmark for Large Language Models in Chinese},
  author = {Liang Xu and Kangkang Zhao and Lei Zhu and Hang Xue},
  journal= {arXiv preprint arXiv:2310.05818},
  year   = {2023}
}

备注

20 pages, 8 tables, 16 figures