大型语言模型在教育语境中识别教学指令的能力:建立基准
计算与语言
2025-12-24 v1
摘要
大型语言模型 (LLM) 越来越被用于教育技术中,涵盖从生成教学材料、辅助评估设计到辅导等各种任务。尽管已有研究探索了如何使模型针对特定任务进行适应或优化,但关于 LLM 在无需显著定制的情况下如何处理真实教育情境的表现了解得不多。随着 LLM 基于系统在日常学术情境中被广泛采用,理解其开箱即用能力变得越来越重要,以设定期望值并建立基准。我们对比了六个 LLM,以估计其在简单但重要的任务上的基准表现:在真实课堂记录中对教学指令进行分类。我们评估了典型的提示方法:零样本、一样本和 few-shot 提示。我们发现尽管零样本表现适中,但提供全面示例 (few-shot 提示) 显著提高了最先进模型的表现,最强的配置达到 Cohen's Kappa = 0.58,对 expert 编码的注释进行评估。与此同时,改进也并非均匀或完整:性能在不同教学指令方面的差异很大,更高的召回率常常以增加假阳性为代价。总体而言,这些发现表明基础模型 demonstrate meaningful yet limited capacity 来解释教学话语,提示设计有助于显现能力但并不消除根本可靠性约束。
关键词
引用
@article{arxiv.2512.19903,
title = {How well do Large Language Models Recognize Instructional Moves? Establishing Baselines for Foundation Models in Educational Discourse},
author = {Kirk Vanacore and Rene F. Kizilcec},
journal= {arXiv preprint arXiv:2512.19903},
year = {2025}
}