中文

我们能信赖LLM作为我们的学生导师吗?评估LLM生成反馈在统计考试中的质量

其他统计学 2025-11-07 v1

摘要

教师提供有意义的个性化反馈是核心挑战之一,尤其是在大型课程中。面对时间和资源的限制,教师常被迫依赖泛化反馈,尽管更个性化的支持在教育学上更具价值。为克服这一限制,有一种潜在技术解决方案是利用大型语言模型(LLM)。在一个新平台的探索性研究中,我们在慕尼黑大学(德国)的“统计学导论”课程中进行了一次LLM纠错的模拟考试。该在线平台允许教师上传练习题及正确解答。学生完成这些练习后,获得整体反馈以及由GPT-4根据讲师提供的正确答案生成的个性化反馈。最终数据集包含所有参与学生的任务级信息,包括 individual responses and corresponding LLM-generated feedback。我们的系统性分析发现,约有7%的2389条反馈实例包含错误, ranging from minor technical inaccuracies to conceptually misleading explanations. 此外,通过结合反馈框架方法,我们发现反馈主要聚焦于解释答案为何正确或错误,较少提供更深层的概念洞察、学习策略或自我调节建议。这些发现凸显了将LLM作为可扩展反馈工具在高等教育中潜在价值与局限性,强调在最大化其教育价值方面需要谨慎的质量监控和提示设计。

关键词

引用

@article{arxiv.2511.04213,
  title  = {Can we trust LLMs as a tutor for our students? Evaluating the Quality of LLM-generated Feedback in Statistics Exams},
  author = {Markus Herklotz and Niklas Ippisch and Anna-Carolina Haensch},
  journal= {arXiv preprint arXiv:2511.04213},
  year   = {2025}
}

备注

Preprint