中文

大型语言模型能否识别学生代码解释中的缺口和误解?

计算机与社会 2025-01-22 v1 人工智能 软件工程

摘要

本文探讨了 various approaches 使用大型语言模型(LLM)识别学生对特定教学材料的自我解释中存在的缺口和误解。具体来说是学生对代码示例的解释。这项研究是我们更大规模努力的一部分,旨在自动评估学生自由生成的响应,特别是针对代码理解活动中学生对代码示例的自我解释。在本工作中,我们对零样本提示、监督微调(SFT)和偏好对齐的LLM进行了实验,以识别学生自我解释中的缺口。通过简单提示,GPT-4在识别缺口和误解方面始终优于LLaMA3和Mistral,人类评估结果印证了这一点。此外,我们的结果表明,经过微调的大型语言模型在识别学生解释中缺口方面优于零样本和few-shot提示技术。进一步地,我们的发现显示,使用机率比偏好优化(ORPO)的偏好优化方法在识别学生代码解释中的缺口和误解方面优于SFT。

关键词

引用

@article{arxiv.2501.10365,
  title  = {Can LLMs Identify Gaps and Misconceptions in Students' Code Explanations?},
  author = {Priti Oli and Rabin Banjade and Andrew M. Olney and Vasile Rus},
  journal= {arXiv preprint arXiv:2501.10365},
  year   = {2025}
}