中文

FoundationalASSIST:面向基础知识追踪与教育学依托的教育数据集

计算机与社会 2026-02-03 v1 计算与语言 机器学习

摘要

大型语言模型能否理解学生的学习方式?随着LLM被用于自适应测试和个性化辅导,这个问题变得迫切——然而,现有资源无法为我们提供答案。当前教育数据集仅提供问题标识符和二元正确性标签,使其对推理自然语言的LLM而言难以理解。为填补这一空白,我们提出了FoundationalASSIST,这是第一个提供完整信息以支持LLM教育研究的英文教育数据集:包含完整问题文本、实际学生作答(而非仅限正确/错误),记录学生选择的错误答案,以及与Common Core K-12标准的对齐。这些来自5000名学生的170万条互动数据,使我们能够开展此前不可能 pursuing 的研究方向,从而包括微调学生模型到分析误解模式。为展示数据集的实用性,我们对四个前沿模型(GPT-OSS-120B、Llama-3.3-70B、Qwen3-Next-80B变体)在两个互补任务族上进行评估:知识追踪(测试LLM能否预测学生对问题的表现和具体作答),以及"教育学依托"(测试LLM能否理解使评估项目有效的属性)。我们的评估结果表明,当前LLM能力存在显著差距。每个模型在知识追踪上仅能达到基准的平凡水平。所有模型在项目判别力上跌破随机猜测的水平,表明LLM尚不理解什么样的问题更具诊断性。模型在判断相对难度方面表现出一定能力(最高可达68.6%),但这仅进一步凸显了其他方面的差距。这些结果表明,在LLM能够可靠地大规模支持个性化学习之前,仍需取得显著进展。我们发布FoundationalASSIST以支持这些基础性挑战的进一步发展。

关键词

引用

@article{arxiv.2602.00070,
  title  = {FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs},
  author = {Eamon Worden and Cristina Heffernan and Neil Heffernan and Shashank Sonkar},
  journal= {arXiv preprint arXiv:2602.00070},
  year   = {2026}
}