用于计算机科学教育的 LLM 集成评分与申诉解决
人机交互
2025-04-21 v1
摘要
本研究探讨了将大型语言模型 (LLM) 集成到计算机科学教育中的评分与申诉解决流程中。我们引入 AI-PAT,这是一个人工智能驱动的评估工具,利用 LLM 对计算机科学考试进行评估、生成反馈并处理学生申诉。AI-PAT 用于评估超过 850 份考试提交物并处理 185 起申诉案件。我们的多模型比较 (ChatGPT、Gemini) 显示模型输出之间存在较强的相关性,尽管根据配置和提示设计的不同仍存在显著变异。人类评分者虽然在内部一致性方面表现良好,但在评分间一致性方面存在显著差异,这进一步凸显了手动评估中的主观性。申诉过程导致 74% 的案件改分,表明需要进一步完善 AI 评估策略。虽然学生欣赏 AI 反馈的速度和细节,但调查显示他们对信任度和公平性存有顾虑。我们得出结论,AI-PAT 为形式化评估和反馈提供了可扩展的优势,但必须配合透明的评分标准、人工监督和申诉机制,以确保结果的公平性。
引用
@article{arxiv.2504.13557,
title = {Integrating LLMs for Grading and Appeal Resolution in Computer Science Education},
author = {I. Aytutuldu and O. Yol and Y. S. Akgul},
journal= {arXiv preprint arXiv:2504.13557},
year = {2025}
}
备注
13 pages, 5 figures