中文

大型语言模型在学生评估中的应用:对比 ChatGPT 与人类评分者

综合经济学 2024-06-25 v1 经济学

摘要

本研究探讨了大型语言模型(LLM)作为学生论文批改工具的效能。该研究选取了60篇政治学硕士论文,比较了 GPT-4 模型所提出的成绩与大学教师所给的成绩。结果表明,尽管 GPT-4 在平均分数上与人类评分标准一致,但其评分模式偏好风险规避,其与人类评分者的项目可靠性较低。此外,修改评分指令(prompt engineering)并未显著改变 AI 的表现,表明 GPT-4 主要评估论文的通用特征如语言质量,而非针对细化的评分标准进行适应。这些发现为理解 AI 在高等教育中的潜力与局限性提供了依据,突显出需进一步发展以提升其适应性和对特定教育评估要求的敏感性的必要性。

关键词

引用

@article{arxiv.2406.16510,
  title  = {Large Language Models in Student Assessment: Comparing ChatGPT and Human Graders},
  author = {Magnus Lundgren},
  journal= {arXiv preprint arXiv:2406.16510},
  year   = {2024}
}