中文

语言模型衡量教育指令质量的承诺与陷阱

计算与语言 2025-01-03 v1 人工智能

摘要

评估指令质量是教育系统任何改进努力的基本组成部分。然而,传统的手动评估昂贵、主观且高度依赖观察者的专业知识和个人因素,导致教师无法获得及时和频繁的反馈。与此前大多数聚焦于单一基础上低推断指令实践的研究不同,本文首次利用自然语言处理(NLP)技术评估两个不同教育情境下多种高推断指令实践:面向面 K-12 课堂和面向在职教师模拟实践任务。本研究也是首次将NLP应用于衡量被广泛认可为对特殊需求学生尤其有效的教学实践。我们面临两种内在于NLP-based指令分析的挑战:噪声和长输入数据以及人类评分高度倾斜的分布。我们的结果表明,预训练语言模型(PLMs)在更离散且需要较低推断的变量方面表现出与人类评判者一致性相当的水平,但在更复杂的教学实践方面效果下降。有趣的是,仅使用教师言语作为输入即可获得强烈结果,这减轻了在面向面教学情境中收集和转录高质量学生语音数据的常见担忧。我们的发现凸显了当前NLP技术在教育领域的潜力与局限,为进一步探索开辟了道路。

关键词

引用

@article{arxiv.2404.02444,
  title  = {The Promises and Pitfalls of Using Language Models to Measure Instruction Quality in Education},
  author = {Paiheng Xu and Jing Liu and Nathan Jones and Julie Cohen and Wei Ai},
  journal= {arXiv preprint arXiv:2404.02444},
  year   = {2025}
}

备注

NAACL 2024