中文

面向编程作业的情境感知 LLM 评分:StepGrade

软件工程 2025-03-28 v1

摘要

编程作业的评分是一项耗时且需要仔细评估代码多个维度的工作。为克服这些挑战,人们利用自动化评分系统来提高效率并减轻教育者的负担。传统的自动化评分系统通常仅关注正确性,无法为学生提供可解释的评估或可操作的反馈。本研究引入 StepGrade,探索使用大语言模型(LLM)的链条思维(Chain-of-Thought, CoT)提示技术,以创新性地解决这些挑战。与常规提示相比,CoT 提示允许模型逐步推理,穿透评估标准之间的相互关联,即功能、代码质量和算法效率,从而确保更全面且透明的评估。这种相互关联性 necessitates 使用 CoT 来系统性地解决每个标准,同时考虑它们之间的相互影响。为经验证明 StepGrade 的效率,我们进行了案例研究,涉及 30 项 Python 编程作业,分为三个难度级别(简单、中等和高级)。该方法的结果显示,CoT 提示在评分质量和可解释性方面显著优于常规提示。通过减少手动评分所需的时间和精力,本研究表明,搭配 CoT 提示 的 GPT-4 有望通过可扩展且具有教育学效益的自动化评分系统, revolutionizes 编程教育。

关键词

引用

@article{arxiv.2503.20851,
  title  = {StepGrade: Grading Programming Assignments with Context-Aware LLMs},
  author = {Mohammad Akyash and Kimia Zamiri Azar and Hadi Mardani Kamali},
  journal= {arXiv preprint arXiv:2503.20851},
  year   = {2025}
}

备注

Accepted to the 15th IEEE Integrated STEM Education Conference (ISEC)