中文

用于编程教育中自动作业评估的大型语言模型系统比较:探索架构与供应商的重要性

计算机与社会 2025-10-01 v1

摘要

本研究对当代大型语言模型(LLM)在编程作业自动评分中进行了首次大规模的并行比较。基于在一门入门级编程课程四年中收集的超过 6,000 份学生提交,我们系统分析了成绩分布、反映更严格或更宽松评分的均分差异与变异性,以及各模型间评分模式的一致性与聚类。评估了十八个公开可用的模型:Anthropic(claude-3-5-haiku, claude-opus-4-1, claude-sonnet-4);Deepseek(deepseek-chat, deepseek-reasoner);Google(gemini-2.0-flash-lite, gemini-2.0-flash, gemini-2.5-flash-lite, gemini-2.5-flash, gemini-2.5-pro);以及 OpenAI(gpt-4.1-mini, gpt-4.1-nano, gpt-4.1, gpt-4o-mini, gpt-4o, gpt-5-mini, gpt-5-nano, gpt-5)。统计检验、相关性与聚类分析揭示了供应商家族之间及内部的明显、系统性差异,其中“mini”与“nano”变体的表现始终逊于其全规模对应版本。所有模型均表现出高内部一致性(由组内相关系数衡量),与模型共识一致,但与人类教师评分的一致性仅为中等,表明自动评估与人工评估之间存在持续差距。这些发现强调,用于教育部署的模型选择并非中立,应受教学目标、评估指标的透明报告以及持续的人工监督的指导,以确保准确性、公平性与相关性。

关键词

引用

@article{arxiv.2509.26483,
  title  = {A systematic comparison of Large Language Models for automated assignment assessment in programming education: Exploring the importance of architecture and vendor},
  author = {Marcin Jukiewicz},
  journal= {arXiv preprint arXiv:2509.26483},
  year   = {2025}
}