运用多面尺度 Rasch 模型比较人类与 AI 评分者效应
计算与语言
2025-05-30 v2 机器学习
摘要
大型语言模型(LLM)已被广泛用于自动评分,以促进学习和教学。在实际应用中,对哪些 LLM 能产生最可靠的评分且对人类评分者效应影响最小尚无充分的实证证据。本研究将十个 LLM(ChatGPT 3.5、ChatGPT 4、ChatGPT 4o、OpenAI o1、Claude 3.5 Sonnet、Gemini 1.5、Gemini 1.5 Pro、Gemini 2.0,以及 DeepSeek V3 和 DeepSeek R1)与人类专家评分者进行比较,对两种写作任务进行评分。以二次加权 Kappa 系数评估 LLM 的整体和分析性评分准确性。以 Cronbach Alpha 系数比较 LLM 与人类评分者在提示词下的内部分一致性。采用多面尺度 Rasch 模型评估 LLM 的评分者效应并与人类评分者进行比较。结果总体上支持在评分准确性、评分可靠性和评分者效应方面使用 ChatGPT 4o、Gemini 1.5 Pro 和 Claude 3.5 Sonnet。
引用
@article{arxiv.2505.18486,
title = {Comparing Human and AI Rater Effects Using the Many-Facet Rasch Model},
author = {Hong Jiao and Dan Song and Won-Chan Lee},
journal= {arXiv preprint arXiv:2505.18486},
year = {2025}
}