E-EVAL:面向大语言模型的综合中国 K-12 教育评估基准
计算与语言
2024-01-30 v1
摘要
随着大语言模型(LLM)的加速发展,许多 LLM 开始被应用于中国 K-12 教育领域。LLM 与教育的融合日益紧密,然而,目前尚无专注于中国 K-12 教育领域的 LLM 评估基准。因此,迫切需要一个全面的自然语言处理基准,以准确评估各种 LLM 在中国 K-12 教育领域的能力。为此,我们引入了 E-EVAL,这是首个专门为中国 K-12 教育领域设计的综合评估基准。E-EVAL 包含 4,351 道涵盖小学、初中和高中水平的多项选择题,涉及广泛的学科,包括语文、英语、政治、历史、道德与法治、物理、化学、数学和地理。我们在先进的 LLM 上对 E-EVAL 进行了全面评估,包括以英语为主导和以中文为主导的模型。结果显示,与以英语为主导的模型相比,以中文为主导的模型表现良好,许多模型的得分甚至超过了 GPT 4.0。然而,几乎所有模型在数学等复杂学科中表现不佳。我们还发现,大多数以中文为主导的 LLM 在小学阶段的得分并未高于初中阶段。我们观察到,模型对高阶知识的掌握并不一定意味着对低阶知识的掌握。此外,实验结果表明,思维链(CoT)技术仅对具有挑战性的理科科目有效,而 Few-shot 提示对文科科目更有益。借助 E-EVAL,我们旨在分析 LLM 在教育应用中的优势与局限性,并为中国 K-12 教育和 LLM 的进步与发展做出贡献。
引用
@article{arxiv.2401.15927,
title = {E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models},
author = {Jinchang Hou and Chang Ao and Haihong Wu and Xiangtao Kong and Zhigang Zheng and Daijia Tang and Chengming Li and Xiping Hu and Ruifeng Xu and Shiwen Ni and Min Yang},
journal= {arXiv preprint arXiv:2401.15927},
year = {2024}
}