中文

C-Eval:面向基础模型的多层级多学科中文评测套件

计算与语言 2023-11-07 v3

摘要

随着大语言模型(LLMs)的快速发展,亟需新的 NLP 基准与之对齐。我们提出 C-Eval,首个全面的中文评测套件,旨在评估基础模型在中文语境下的高级知识与推理能力。C-Eval 包含跨越四个难度层级(初中、高中、大学及专业)的选择题,题目涵盖从人文到理工的 52 个不同学科。C-Eval 附有 C-Eval Hard,其为 C-Eval 中极具挑战性的学科子集,需高级推理能力方可解答。我们对最先进的 LLMs(包括英文与中文导向的模型)在 C-Eval 上进行了全面评测。结果表明,仅 GPT-4 平均准确率超过 60%,说明当前 LLMs 仍有显著提升空间。我们期望 C-Eval 能有助于分析基础模型的重要优势与不足,并促进其为中文用户的发展与成长。

关键词

引用

@article{arxiv.2305.08322,
  title  = {C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models},
  author = {Yuzhen Huang and Yuzhuo Bai and Zhihao Zhu and Junlei Zhang and Jinghan Zhang and Tangjun Su and Junteng Liu and Chuancheng Lv and Yikai Zhang and Jiayi Lei and Yao Fu and Maosong Sun and Junxian He},
  journal= {arXiv preprint arXiv:2305.08322},
  year   = {2023}
}

备注

NeurIPS 2023. Website: https://cevalbenchmark.com