EduEval:用于评估大语言模型在中国教育领域的分层认知基准
计算与语言
2025-12-02 v1 人工智能
摘要
大语言模型(LLM)在教育应用方面展现出巨大的潜力。然而,未经审慎的部署可能危及教育标准,亟需进行严格的评估。我们提出了 EduEval,这是一个用于评估大语言模型在中国 K-12 教育中的综合性分层基准。该基准作出了三项关键贡献:(1)认知框架:我们提出了 EduAbility 分类法,将布鲁姆分类法与韦伯知识深度等级统一,以组织包括记忆、理解、应用、推理、创造和伦理在内的六个认知维度上的任务;(2)真实性:我们的基准整合了真实考试题目、课堂对话、学生作文和专家设计的提示,反映真实的教育挑战;(3)规模:EduEval 包含 24 种不同的任务类型,涵盖从小学到高中共计超过 11,000 题。我们在零样本和 few-shot 设置下评估了 14 家领先的大语言模型,发现虽然模型在事实性任务上表现良好,但在课堂对话分类方面表现不足,且在创造性内容生成中结果不一致。有趣的是,一些开源模型在复杂教育推理方面甚至超过了专有系统。few-shot 提示的效果在不同认知维度上存在差异,表明不同的教育目标需要量身定制的方法。这些发现为开发针对多样化中国教育任务优化的大语言模型提供了有针对性的基准指标。
引用
@article{arxiv.2512.00290,
title = {EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education},
author = {Guoqing Ma and Jia Zhu and Hanghui Guo and Weijie Shi and Yue Cui and Jiawei Shen and Zilong Li and Yidan Liang},
journal= {arXiv preprint arXiv:2512.00290},
year = {2025}
}