利用大语言模型评估真实对话中的教师行为:可行性研究
计算与语言
2025-06-24 v1 计算机与社会
摘要
教学可提高学生成绩,但如何基于音频转录文本在规模上识别并研究哪些教学行为与学生学习相关,仍是开放的研究问题。本研究探讨了使用生成式 AI 来识别和评估真实数学 tutoring 中特定教师行为的可行性和可扩展性。我们分析了 50 份随机抽取的大学学生远程教师协助中学生数学学习的 transcript。使用 GPT-4、GPT-4o、GPT-4-turbo、Gemini-1.5-pro 和 LearnLM,我们评估教师在两项教师技能上的应用:提供有效赞美和回应学生的数学错误。所有模型都可靠地检测到相关情境,例如教师对学生的赞美 (94-98% 准确率) 和学生的数学错误 (82-88% 准确率),并与人类判断结果高度一致(分别为 83-89% 和 73-77%)。我们提出一种成本效益高的提示策略,并讨论在大型语言模型用于支持真实场景中可扩展评估方面的实际影响。本工作进一步提供了支持 AI 支持学习中可重复性和研究的 LLM 提示语。
引用
@article{arxiv.2506.17410,
title = {Leveraging LLMs to Assess Tutor Moves in Real-Life Dialogues: A Feasibility Study},
author = {Danielle R. Thomas and Conrad Borchers and Jionghao Lin and Sanjit Kakarla and Shambhavi Bhushan and Erin Gatz and Shivang Gupta and Ralph Abboud and Kenneth R. Koedinger},
journal= {arXiv preprint arXiv:2506.17410},
year = {2025}
}
备注
Short research paper accepted at EC-TEL 2025