中文

使用大语言模型评估教师的教学内容知识

人工智能 2025-05-27 v1 计算机与社会

摘要

通过基于表现的任务评估教师的教学内容知识既耗时又费力。虽然大语言模型(LLM)为高效的自动评分提供了新机遇,但关于LLM是否以与传统机器学习(ML)和人类评分者相似或不同的方式引入构念无关方差(CIV),人们知之甚少。本研究在针对两个PCK子构念(分析学生思维和评估教师回应性)的基于视频的建构性反应任务背景下,考察了CIV的三个来源——情境变异性、评分者严厉度和评分者对情境的敏感度。使用广义线性混合模型(GLMMs),我们比较了三种评分来源(人类评分者、有监督ML和LLM)的方差分量和评分者层面的评分模式。结果表明,不同任务间的情境层面方差极小,而评分者相关因素对CIV贡献显著,尤其是在更具解释性的任务II中。ML模型是最严厉且最不敏感的评分者,而LLM是最宽松的。这些发现表明,LLM在提高评分效率的同时,也会像人类评分者那样引入CIV,但与有监督ML相比其贡献程度有所不同。讨论了对评分者培训、自动评分设计以及未来模型可解释性研究的启示。

关键词

引用

@article{arxiv.2505.19266,
  title  = {Using Large Language Models to Assess Teachers' Pedagogical Content Knowledge},
  author = {Yaxuan Yang and Shiyu Wang and Xiaoming Zhai},
  journal= {arXiv preprint arXiv:2505.19266},
  year   = {2025}
}