中文

利用 LLM 与 BoW 自动评估课堂Instructional Support:从全局预测到具体反馈

计算与语言 2024-04-18 v4 人工智能

摘要

为了向教师提供更具体、更频繁且可操作的施教反馈,我们探索如何利用大语言模型(LLM)来估计 CLassroom Assessment Scoring System(CLASS)中“Instructional Support”领域的分数,该协议是一种广泛使用的观察量表。我们设计了一种机器学习架构,使用 Meta 的 Llama2 的零样本提示和/或经典的词袋(BoW)模型,对教师的单个话语(使用 OpenAI 的 Whisper 自动转写)进行分类,判断其中是否存在 Instructional Support。随后,这些话语级判断在 15 分钟观察会话上聚合以估计全局 CLASS 分数。在两个针对幼儿与学前教室的 CLASS 编码数据集上的实验表明:(1)使用所提方法的自动 CLASS Instructional Support 估计准确度(Pearson RR 最高达 0.480.48)接近人工评分者间信度(最高 R=0.55R=0.55);(2)LLM 在此任务上通常比 BoW 准确度略高,但最佳模型常结合从 LLM 与 BoW 中提取的特征;(3)在对单个话语分类方面,自动方法相比人类水平判断仍有改进空间。最后,(4)我们展示了如何在话语级可视化模型输出,为教师提供可解释的反馈,说明哪些话语与特定 CLASS 维度最正或最负相关。

关键词

引用

@article{arxiv.2310.01132,
  title  = {Automated Evaluation of Classroom Instructional Support with LLMs and BoWs: Connecting Global Predictions to Specific Feedback},
  author = {Jacob Whitehill and Jennifer LoCasale-Crouch},
  journal= {arXiv preprint arXiv:2310.01132},
  year   = {2024}
}