中文

MalruleLib:大规模可执行误解推理带步骤痕迹的学生思维建模

计算与语言 2026-01-07 v1

摘要

学生在数学中的错误往往是系统性的:学习者会应用连贯但错误的程序,并在不同情境中重复应用。我们引入 MalruleLib,一个以学习科学为基础的框架,将记录的误解转化为可执行程序,基于 67 个学习科学和数学教育来源,生成误规则一致学生作品的逐步痕迹。我们将核心学生建模问题形式化为误规则推理准确度 (MRA):从一个 worked 错误中推断误解,并预测学生在跨模板重述下的下一个答案。在九个语言模型(4B-120B)上,准确率从直接问题解决时的 66% 下降到跨模板误解预测时的 40%。MalruleLib 对 101 条误规则进行编码,覆盖 498 个可参数化问题模板,产生正确推理和误规则一致学生推理的配对双路径痕迹。由于误规则是可执行的且模板是可参数化的,MalruleLib 能够生成超过一百万个实例,实现可扩展的监督和受控评估。使用 MalruleLib,我们观察到跨模板降解为 10-21%,而提供学生步骤痕迹可使预测准确率提高 3-15%。我们将 MalruleLib 发布为教育 AI 基础设施,用于跨情境建模学生程序,实现针对底层误解的诊断和反馈。

关键词

引用

@article{arxiv.2601.03217,
  title  = {MalruleLib: Large-Scale Executable Misconception Reasoning with Step Traces for Modeling Student Thinking in Mathematics},
  author = {Xinghe Chen and Naiming Liu and Shashank Sonkar},
  journal= {arXiv preprint arXiv:2601.03217},
  year   = {2026}
}