中文

K12-KGraph:面向教育大语言模型评测与训练的课程对齐知识图谱

计算与语言 2026-05-12 v1

摘要

大语言模型 (LLM) 越来越多地应用于 K-12 教育中,然而现有的基准测试(如 C-Eval、CMMLU、GaokaoBench 和 EduEval)主要通过考试型问答来评估事实回忆。有效的教育 AI 还需要课程认知:理解知识如何通过先修链、概念分类法、实验-概念关联和教学顺序进行结构化。为弥补这一空白,我们引入了 K12-KGraph,这是一个从小学到高中的人民教育出版社官方教材中提取的、涵盖数学、物理、化学和生物的课程对齐知识图谱。该图谱包含七种节点类型(概念、技能、实验、练习、节、章、书)和九种关系类型,涵盖分类、先修、关联、验证、评估、位置和顺序。基于该图谱,我们构建了两个资源:(1) K12-Bench,一个包含 23,640 道多选题的基准测试,涵盖五个源自图谱的任务族(Ground、Prereq、Neighbor、Evidence 和 Locate);(2) K12-Train,一个由图谱结构和节点属性合成的、包含约 2,300 个问答对的 KG 引导监督微调语料库。实验揭示了课程认知方面的显著缺陷:在 K12-Bench 上,Gemini-3-Flash 仅达到 57% 的精确匹配率,而表现最好的开源模型 Gemma-4-31B-IT 达到 46%。在 Qwen3-4B-Base 和 Llama-3.1-8B-Base 上严格匹配的 2,300 样本 SFT 预算下,K12-Train 在 GaokaoBench 和 EduEval 上均持续优于来自八个主流指令微调语料库的同等规模子集,表明课程结构化监督在教育微调中具有极高的样本效率。我们发布了该图谱、基准测试、训练数据和完整的构建流程。

关键词

引用

@article{arxiv.2605.09635,
  title  = {K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs},
  author = {Hao Liang and Qihan Lin and Zhaoyang Han and Xiaochen Ma and Zhen Hao Wong and Meiyi Qiang and Linzhuang Sun and Wentao Zhang},
  journal= {arXiv preprint arXiv:2605.09635},
  year   = {2026}
}