利用大型语言模型评估导师应对学生数学错误的表现
人机交互
2024-01-09 v1 人工智能
计算机与社会
摘要
研究表明,导师在应对低自我效能感学生的数学错误时应采取策略性方法。导师不应直接指出错误,而应引导学生自行识别并纠正错误。虽然导师培训已引入这一教学技能,但对导师应用该策略的人工评估既艰巨又耗时。大型语言模型(LLM)有望在导师实际辅导过程中提供实时评估,然而人们对其在此情境下的准确性知之甚少。本研究探讨了生成式人工智能评估真实导师应对学生数学错误表现的能力。通过分析 50 段真实辅导对话,我们发现 GPT-3.5-Turbo 和 GPT-4 在评估与应对学生错误相关的标准方面均表现出熟练度。然而,这两个模型在识别学生犯错实例方面均存在局限性。值得注意的是,GPT-4 倾向于过度识别学生犯错的情况,经常将学生的不确定性归因为错误或推断出人类评估者未发现的潜在错误。未来的工作将侧重于通过评估更大规模的对话数据集和评估学习迁移来增强泛化能力。具体而言,我们将分析导师在完成关于这一关键辅导技能的课程前后,在真实场景中应对学生数学错误的表现。
引用
@article{arxiv.2401.03238,
title = {Using Large Language Models to Assess Tutors' Performance in Reacting to Students Making Math Errors},
author = {Sanjit Kakarla and Danielle Thomas and Jionghao Lin and Shivang Gupta and Kenneth R. Koedinger},
journal= {arXiv preprint arXiv:2401.03238},
year = {2024}
}
备注
13 page Workshop paper, AAAI2024 Workshop on AI for Education - Bridging Innovation and Responsibility, Tutoring, Tutor evaluation, Real-time feedback, Math learning, LLMs, GPT-4