中文

教育性程序修复基准测试

软件工程 2024-05-10 v1 人工智能 计算与语言 计算机与社会

摘要

大型语言模型(LLMs)的出现因其跨一系列教育任务的潜在应用而引发了极大的兴趣。例如,编程教育领域的近期工作利用LLMs生成学习资源、改进错误消息并提供代码反馈。然而,限制该领域发展的一个因素是,许多研究使用定制的数据集和不同的评估指标,使得结果之间的直接比较不可靠。因此,迫切需要标准化和基准测试,以促进对竞争方法的公平比较。程序修复是LLMs展现出巨大前景的一项任务,可用于为学生提供调试支持和下一步提示。在本文中,我们提出了一个新颖的教育性程序修复基准。我们策划了两个高质量的公开编程数据集,提出了一个统一的评估程序并引入了新的评估指标rouge@k用于近似修复质量,并评估了一组五个最新模型以建立基线性能。

关键词

引用

@article{arxiv.2405.05347,
  title  = {Benchmarking Educational Program Repair},
  author = {Charles Koutcheme and Nicola Dainese and Sami Sarsa and Juho Leinonen and Arto Hellas and Paul Denny},
  journal= {arXiv preprint arXiv:2405.05347},
  year   = {2024}
}

备注

15 pages, 2 figures, 3 tables. Non-archival report presented at the NeurIPS'23 Workshop on Generative AI for Education (GAIED)