LHMKE:面向中文大语言模型的大规模整体多学科知识评估基准
计算与语言
2024-03-20 v1
摘要
中文大语言模型(LLMs)近期在各种NLP基准和实际应用中展示了令人印象深刻的能力。然而,用于全面评估这些LLMs的现有基准仍然不足,特别是在衡量LLMs所掌握的知识方面。当前的数据集通过收集来自不同学科和教育水平的中国考试题目来解决这一问题。但这些基准主要侧重于客观题,如多项选择题,导致题型缺乏多样性。为解决此问题,我们在本文中提出了LHMKE,一个大规模、整体性、多学科知识评估基准。LHMKE旨在为中文LLMs的知识获取能力提供全面评估。它包含10,465个问题,涵盖75项任务,涉及30个学科,范围从小学到专业认证考试。值得注意的是,LHMKE同时包含客观题和主观题,从而能更整体地评估LLMs的知识水平。我们在与真实考试一致的零样本设定下评估了11个中文LLMs,并比较了它们在不同学科上的表现。我们还进行了深入分析,以检验GPT-4是否能自动评阅主观预测。我们的发现表明,LHMKE是中文LLMs的一个具有挑战性且先进的测试平台。
引用
@article{arxiv.2403.12601,
title = {LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models},
author = {Chuang Liu and Renren Jin and Yuqi Ren and Deyi Xiong},
journal= {arXiv preprint arXiv:2403.12601},
year = {2024}
}
备注
Accepted by LREC-COLING 2024