SciEval:K-12 科学教学材料自动评估基准
人工智能
2026-04-29 v1
摘要
随着越来越多的教育工作者使用生成式 AI 创建教学材料,评估 K-12 科学教育教学材料的需求变得日益重要。然而,对教学材料的审查耗时、需要密集的专业知识且难以规模化,这促使了人们对自动评估方法的兴趣。尽管大型语言模型(LLMs)在一般评估任务上表现出色,但其在教学材料上的表现和可靠性仍不清楚。为了填补这一空白,我们将自动教学材料评估(AIME)制定为一项生成式 AI 任务,该任务使用教育工作者设计的评分标准来预测分数和证据。我们创建了一个基准数据集并为 AIME 开发了基线模型。首先,我们策划了首个 AIME 数据集 SciEval,包含带有教学法对齐评估分数和基于证据的理由的教学材料。专家标注实现了较高的评分者间信度,最终形成了一个包含 273 份课程级教学材料的数据集,使用 EQuIP 评分标准跨 13 个标准进行了评估(N=3549)。其次,我们在 SciEval 上测试了主流 LLMs(GPT、Gemini、Llama 和 Qwen),发现没有模型能取得出色表现。然后我们在 SciEval 上对 Qwen3 进行了微调。在留出测试集上的结果表明,领域对齐的微调可实现高达 11% 的性能提升,突出了领域特定微调对 AIME 的重要性,并促进了 LLMs 在其他教育任务中的使用。
引用
@article{arxiv.2604.25472,
title = {SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials},
author = {Zhaohui Li and Peng He and Zhiyuan Chen and Honglu Liu and Zeyuan Wang and Tingting Li and Jinjun Xiong},
journal= {arXiv preprint arXiv:2604.25472},
year = {2026}
}