OmniEduBench:面向大语言模型教育评估的综合中文基准
计算与语言
2025-10-31 v1
摘要
随着大型语言模型 (LLM) 的快速发展,基于 LLM 的诸多研究在教育领域得到了广泛应用。然而,现有大多数 LLM 及其基准主要聚焦于知识维度,很少评估那些对于真实教育场景至关重要的培养能力。此外,当前的基准往往仅限于单一学科或单一 question 类型,缺乏足够的多样性。这一问题在中国语境下尤为突出。为此,我们引入 OmniEduBench,一个综合性的中文教育基准。OmniEduBench 包含 24.602 条高质量的问答对。数据细致划分为知识维度和培养维度两大核心维度,分别包含 18.121 条和 6.481 条条目。每个维度进一步细分为 6 个细粒度类别,涵盖总计 61 个不同学科 (知识维度 41 个,培养维度 20 个)。此外,该数据集拥有丰富的 question 格式多样性,包括 11 种常见考试 question 类型,为全面评估 LLM 在教育领域的能力提供了坚实基础。对 11 个主流开源和闭源 LLM 进行大规模实验,结果显示出显著的性能差距。在知识维度上,仅有 Gemini-2.5 Pro 超过 60% 的准确率;而在培养维度中,最佳表现模型 QWQ 仍落后于人类智慧近 30%。这些结果凸显了仍有广阔的提升空间,也凸显了将 LLM 应用于教育领域的挑战。
引用
@article{arxiv.2510.26422,
title = {OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education},
author = {Min Zhang and Hao Chen and Hao Chen and Wenqi Zhang and Didi Zhu and Xin Lin and Bo Jiang and Aimin Zhou and Fei Wu and Kun Kuang},
journal= {arXiv preprint arXiv:2510.26422},
year = {2025}
}