LLM-itation是最诚实的形式:生成用于计算教育的合成有缺陷代码提交
计算机与社会
2024-11-19 v1 软件工程
摘要
计算教育研究需要大量数据。数据用于理解学生行为、训练学生行为模型以最佳方式支持学生,并开发和验证新的评估工具和学习分析技术。然而,计算教育数据集较少公开披露,往往因隐私法规及匿名化问题。大型语言模型(LLM)提供了一个可行的方案,用于创建大规模、隐私保护的合成数据,可用于探索学生学习的各个方面、开发和测试教育技术,并支持在收集真实学生数据困难或不切实际的领域的研究。本工作探索使用GPT-4o生成用于介绍性编程练习的合成有缺陷代码提交。我们将合成数据与两门课程的真实学生数据中测试用例失败分布进行比较,以分析合成数据在模拟真实学生数据方面的准确性。我们的发现表明,LLM可用于生成与真实学生数据在测试用例失败分布上无显著差异的合成错误提交。我们的研究为计算教育研究和教学的可靠合成数据集开发做出了贡献, potentially加快该领域进展,同时保护学生隐私。
引用
@article{arxiv.2411.10455,
title = {LLM-itation is the Sincerest Form of Data: Generating Synthetic Buggy Code Submissions for Computing Education},
author = {Juho Leinonen and Paul Denny and Olli Kiljunen and Stephen MacNeil and Sami Sarsa and Arto Hellas},
journal= {arXiv preprint arXiv:2411.10455},
year = {2024}
}
备注
7 pages, 3 tables, 1 figure