ChatGPT 用于机械通气简答题的自动评分
计算与语言
2026-04-02 v1 机器学习
统计计算
摘要
使用简答题(SAQ)的标准化测试在研究生教育中很常见。大语言模型(LLM)模拟对话语言并解释非结构化自由文本响应,其方式与应用 SAQ 评分标准一致,这使得它们对自动评分具有吸引力。我们使用来自 215 名参加机械通气在线课程(2020-2024 年)的学生数据(557 个简答题回答),评估了 ChatGPT 4o 在研究生医学环境中对 SAQ 进行评分的能力。将三个基于案例场景的去标识化回答与标准化的评分提示和评分标准一起呈现给 ChatGPT。使用混合效应模型、方差分量分析、组内相关系数(ICC)、Cohen's kappa、Kendall's W 和 Bland-Altman 统计对输出进行分析。ChatGPT 给出的分数系统性地低于人工评分员,在 10 分制量表上的平均差异(偏差)为 -1.34。ICC 值表明个体层面的一致性较差(ICC1 = 0.086),Cohen's kappa(-0.0786)表明没有有意义的一致性。方差分量分析显示五次 ChatGPT 会话之间的变异性极小(G 值 = 0.87),表明内部一致性但与人工评分员存在分歧。在评估性和分析性项目上观察到的一致性最差,而清单式和规定性评分标准项目的分歧较小。我们提醒不要使用 LLM 对研究生课程作业进行评分。超过 60% 的 ChatGPT 评分与人工评分的差异超出了高风险评估可接受的界限。
引用
@article{arxiv.2505.04645,
title = {ChatGPT for automated grading of short answer questions in mechanical ventilation},
author = {Tejas Jade and Alex Yartsev},
journal= {arXiv preprint arXiv:2505.04645},
year = {2026}
}