中文

SCALEFeedback:面向 LLM 生成教育性反馈研究的大规模合成计算机科学作业数据集

计算机与社会 2025-08-11 v1

摘要

使用 LLMs 为学生的作业提供教育性反馈已引起广泛关注。然而,目前尚无包含作业描述、评分标准和学生提交内容的大规模开源学生作业数据集跨 various courses,因此限制了通用方法用于自动生成有效且负责任的教育性反馈的研究。本研究构建了一个名为 SCALEFeedback 的大规模数据集,用于 LLM 生成教育性反馈研究(Synthetic Computer science Assignments for LLM-generated Educational Feedback)。我们提出了 Sophisticated Assignment Mimicry(SAM)框架,通过 one-to-one LLM 式模仿从真实作业描述和学生提交内容中生成其合成版本。该开源数据集包含 10,000 条合成学生提交内容,覆盖 155 项作业和 59 所大学水平计算机科学课程。与相应真实作业数据集相比,合成提交内容的 BERTScore F1 为 0.84,作业分数相关系数为 0.62,长度相关系数为 0.85,且确保完全保护了学生隐私信息。上述 SAM 框架的结果均优于 naïve mimicry 方法的基准结果。LLM 生成的反馈在合成作业上的效果与真实作业数据集相当。我们的研究表明,one-to-one LLM 式模仿是一种可行方法,用于生成保护原始数据集语义含义和学生数据分布的同时,同时保护学生隐私和机构版权的开源合成教育数据集。SCALEFeedback 提升了我们开发 LLM 基于方法的通用性高质量自动化教育性反馈能力。

关键词

引用

@article{arxiv.2508.05953,
  title  = {SCALEFeedback: A Large-Scale Dataset of Synthetic Computer Science Assignments for LLM-generated Educational Feedback Research},
  author = {Keyang Qian and Kaixun Yang and Wei Dai and Flora Jin and Yixin Cheng and Rui Guan and Sadia Nawaz and Zachari Swiecki and Guanliang Chen and Lixiang Yan and Dragan Gašević},
  journal= {arXiv preprint arXiv:2508.05953},
  year   = {2025}
}