中文

OpenEval:跨能力、对齐与安全性的中文大语言模型基准评测

计算与语言 2024-03-20 v1

摘要

中文大语言模型(LLMs)的快速发展给高效的 LLM 评测带来了巨大挑战。尽管当前的举措引入了新的基准或评测平台来评估中文 LLM,但其中许多主要关注能力,通常忽视了潜在的对齐与安全性问题。为弥补这一不足,我们推出了 OpenEval,一个跨能力、对齐与安全性对中文 LLM 进行基准评测的测试平台。在能力评估方面,我们纳入了 12 个基准数据集,从 4 个子维度评估中文 LLM:自然语言处理任务、学科知识、常识推理和数学推理。在对齐评估方面,OpenEval 包含 7 个数据集,用于检验中文 LLM 输出中的偏见、冒犯性和非法性。为评估安全性,尤其是先进 LLM 的预期风险(如权力寻求、自我意识),我们纳入了 6 个数据集。除这些基准外,我们还实施了分阶段公开评测与基准更新策略,以确保 OpenEval 与中文 LLM 的发展保持一致,甚至能够提供前沿基准数据集来引导中文 LLM 的发展。在首次公开评测中,我们测试了一系列中文 LLM,参数规模从 7B 到 72B,涵盖开源和闭源模型。评测结果表明,虽然中文 LLM 在某些任务上表现出色,但应更多关注常识推理、对齐和安全性等更广泛的方面。

关键词

引用

@article{arxiv.2403.12316,
  title  = {OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety},
  author = {Chuang Liu and Linhao Yu and Jiaxuan Li and Renren Jin and Yufei Huang and Ling Shi and Junhui Zhang and Xinmeng Ji and Tingting Cui and Tao Liu and Jinwang Song and Hongying Zan and Sun Li and Deyi Xiong},
  journal= {arXiv preprint arXiv:2403.12316},
  year   = {2024}
}