中文

用于学生错误概念精确分类的认知不确定性引导知识蒸馏

机器学习 2026-05-15 v1 人工智能

摘要

准确识别学生的错误概念对个性化教育至关重要,但面临三个挑战:(1)具有长尾分布的数据稀缺,其中真实的推理过程难以合成;(2)错误类别之间边界模糊且标注噪声高;(3)部署悖论——大模型由于预训练偏差而忽略非常规方法且无法部署在边缘设备上,而小模型则容易对噪声过拟合。与通过大规模数据合成增加多样性的传统方法不同,我们提出了一种两阶段知识蒸馏框架,从现有数据中挖掘高价值样本。第一阶段执行标准蒸馏以转移任务能力。第二阶段引入基于认知不确定性的双层边缘选择机制,根据教师模型的不确定性和置信度差异识别出四类关键样本。针对不同数据子集,我们设计了难度自适应机制以平衡硬/软标签的贡献,使学生模型能够从教师模型的软标签中继承类间关系,同时区分模糊的错误类型。实验表明,仅对 10.30% 的过滤样本进行增强训练,我们便在 MAP-Charting 数据集上取得了 0.9585(+17.8%)的 MAP@3;并且仅使用 4B 参数模型,我们就在中学代数错误概念基准的跨主题测试中达到了 84.38% 的准确率,显著优于 SOTA LLM(67.73%)和标准微调的 72B 模型(81.25%)。我们的代码可在 https://github.com/RoschildRui/acl2026_map 获取。

关键词

引用

@article{arxiv.2605.14752,
  title  = {Cognitive-Uncertainty Guided Knowledge Distillation for Accurate Classification of Student Misconceptions},
  author = {Qirui Liu and Hao Chen and Weijie Shi and Jiajie Xu and Jia Zhu},
  journal= {arXiv preprint arXiv:2605.14752},
  year   = {2026}
}

备注

ACL 2026 Findings. 10 pages, 5 figures, 19 tables