中文

M3KE:面向中文大型语言模型的大规模多层级多学科知识评估基准

计算与语言 2023-05-23 v2

摘要

大型语言模型近期在跨任务泛化、指令遵循等多个方面取得了巨大进展。在多种任务中全面评估大型语言模型的能力具有重要意义。本文提出 M3KE,一个大规模多层级多学科知识评估基准,旨在通过在零样本和少样本设置下测试中文大型语言模型的多任务准确率,来衡量其习得的知识。我们从 71 项任务中收集了 20,477 道问题。我们的选择涵盖了从小学到大学的中国教育体系的所有主要层级,以及包括人文、历史、政治、法律、教育、心理学、科学、技术、艺术和宗教在内的广泛学科。所有问题均为带有四个选项的选择题,从而保证了标准化和统一的评估过程。我们在所提出的基准上评估了多个最先进的开源中文大型语言模型。这些模型的参数规模从 335M 到 130B 不等。实验结果表明,它们的性能显著逊于在 M3KE 上达到约 48% 准确率的 GPT-3.5。该数据集可在 https://github.com/tjunlp-lab/M3KE 获取。

关键词

引用

@article{arxiv.2305.10263,
  title  = {M3KE: A Massive Multi-Level Multi-Subject Knowledge Evaluation Benchmark for Chinese Large Language Models},
  author = {Chuang Liu and Renren Jin and Yuqi Ren and Linhao Yu and Tianyu Dong and Xiaohan Peng and Shuting Zhang and Jianxiang Peng and Peiyi Zhang and Qingqing Lyu and Xiaowen Su and Qun Liu and Deyi Xiong},
  journal= {arXiv preprint arXiv:2305.10263},
  year   = {2023}
}