将大型语言模型用于学习者建模的问题:为何仅靠 LLM 无法胜任 K-12 教育中的负责任辅导
人工智能
2025-12-30 v1
摘要
基于大型语言模型 (LLM) 的辅导工具在 K-12 教育中的迅速兴起助长了一种误解,即生成式模型可以取代传统的学习者建模以实现自适应教学。这在 K-12 环境中尤其成问题,因为欧盟《人工智能法案》将其归类为需要负责任设计的高风险领域。出于这些担忧,本研究综合了关于基于 LLM 的辅导工具局限性的证据,并实证调查了一个关键问题:在评估学习者随时间不断演变的知识时的准确性、可靠性和时间连贯性。我们使用一个大型开放获取数据集,将深度知识追踪 (DKT) 模型与一个广泛使用的 LLM 进行了比较,并在零样本和微调设置下进行了评估。结果表明,DKT 在下一步正确性预测上实现了最高的判别性能 (AUC = 0.83),并在各种设置中始终优于 LLM。尽管微调使 LLM 的 AUC 比零样本基线提高了约 8%,但仍比 DKT 低 6%,并且在早期序列中产生更高的错误,而错误预测对自适应支持最为有害。时间分析进一步表明,DKT 保持稳定且方向正确的掌握度更新,而 LLM 变体表现出显著的时间弱点,包括不一致和错误方向的更新。尽管微调后的 LLM 需要近 198 小时的高算力训练,远超 DKT 的计算需求,但这些局限性依然存在。我们对多技能掌握度估计的定性分析进一步表明,即使在微调之后,LLM 产生的掌握度轨迹也不一致,而 DKT 保持了平滑且连贯的更新。总体而言,研究结果表明,仅靠 LLM 不太可能匹敌现有智能辅导系统的有效性,且负责任的辅导需要结合学习者建模的混合框架。
引用
@article{arxiv.2512.23036,
title = {Problems With Large Language Models for Learner Modelling: Why LLMs Alone Fall Short for Responsible Tutoring in K--12 Education},
author = {Danial Hooshyar and Yeongwook Yang and Gustav Šíř and Tommi Kärkkäinen and Raija Hämäläinen and Mutlu Cukurova and Roger Azevedo},
journal= {arXiv preprint arXiv:2512.23036},
year = {2025}
}