大型语言模型在数学 tutoring 中的专家教学水平逼近但在教学和语言轮廓上存在差异
计算与语言
2026-05-28 v3 计算机与社会
摘要
最近的研究探索了大型语言模型 (LLMs) 用于生成数学 tutoring 响应的方式,但尚不清楚其指令行为与专家人类实践有多接近。我们分析了一个包含专家 tutoring 者、初学者 tutoring 者以及七个不同规模的大型语言模型(包括开源和商业模型)的数据集,这些模型针对相同的学生错误作出响应。我们检查了 tutoring 响应的指令策略和语言特征,包括 uptake(复述和复语)、对准确性和推理的追问、词汇多样性、可读性、礼貌性和主动性。我们发现专家 tutoring 者产生的响应质量高于初学者,较大的语言模型在一般情况下获得的教学质量评级高于较小的模型,接近专家水平。然而,大型语言模型在指令轮廓上存在系统性差异:它们在专家 tutoring 者特有的论证策略上使用不足,同时生成更长的、更具词汇多样性和更礼貌的响应。回归分析显示,对准确性和推理的追问、复述和复语,以及词汇多样性,与被认为的教学质量正相关;而更高的主动语言和礼貌语言水平则与被认为的教学质量呈负相关。这些发现突显了在评估 human tutoring 者和智能 tutoring 系统之间的 tutoring 响应时,分析指令策略和语言特征的重要性。
引用
@article{arxiv.2512.20780,
title = {Large Language Models Approach Expert Pedagogical Quality in Math Tutoring but Differ in Instructional and Linguistic Profiles},
author = {Ramatu Oiza Abdulsalam and Segun Aroyehun},
journal= {arXiv preprint arXiv:2512.20780},
year = {2026}
}