中文大语言模型的安全性评估
计算与语言
2023-04-21 v1
摘要
随着 ChatGPT 和 GPT-4 等大语言模型的迅速普及,人们对其安全问题的关注与日俱增。这些模型可能生成侮辱性和歧视性内容,反映不正确的社会价值观,并可能被用于欺诈和传播误导信息等恶意目的。评估并增强其安全性对于大语言模型(LLM)的广泛应用尤为关键。为进一步促进 LLM 的安全部署,我们开发了一个中文 LLM 安全性评估基准。我们的基准从两个角度考察 LLM 的综合安全表现:8 类典型安全场景和 6 类更具挑战性的指令攻击。我们的基准基于一个直接流程,即提供测试提示并评估被评估模型生成回复的安全性。在评估中,我们利用 LLM 强大的评估能力,通过提示将其开发为安全评估器。在此基准之上,我们对包括 OpenAI GPT 系列和其他知名中文 LLM 在内的 15 个 LLM 进行了安全评估与分析,并观察到一些有趣发现。例如,我们发现指令攻击更易暴露所有 LLM 的安全问题。此外,为促进安全、负责和符合伦理的 AI 的发展与部署,我们公开发布了 SafetyPrompts,包含由 LLM 生成的 10 万条增强提示与回复。
引用
@article{arxiv.2304.10436,
title = {Safety Assessment of Chinese Large Language Models},
author = {Hao Sun and Zhexin Zhang and Jiawen Deng and Jiale Cheng and Minlie Huang},
journal= {arXiv preprint arXiv:2304.10436},
year = {2023}
}
备注
Benchmark website: http://coai.cs.tsinghua.edu.cn/leaderboard/ ; SafetyPrompts repo: https://github.com/thu-coai/Safety-Prompts