教育性程序修复基准测试
软件工程
2024-05-10 v1 人工智能
计算与语言
计算机与社会
摘要
大型语言模型(LLMs)的出现因其跨一系列教育任务的潜在应用而引发了极大的兴趣。例如,编程教育领域的近期工作利用LLMs生成学习资源、改进错误消息并提供代码反馈。然而,限制该领域发展的一个因素是,许多研究使用定制的数据集和不同的评估指标,使得结果之间的直接比较不可靠。因此,迫切需要标准化和基准测试,以促进对竞争方法的公平比较。程序修复是LLMs展现出巨大前景的一项任务,可用于为学生提供调试支持和下一步提示。在本文中,我们提出了一个新颖的教育性程序修复基准。我们策划了两个高质量的公开编程数据集,提出了一个统一的评估程序并引入了新的评估指标rouge@k用于近似修复质量,并评估了一组五个最新模型以建立基线性能。
引用
@article{arxiv.2405.05347,
title = {Benchmarking Educational Program Repair},
author = {Charles Koutcheme and Nicola Dainese and Sami Sarsa and Juho Leinonen and Arto Hellas and Paul Denny},
journal= {arXiv preprint arXiv:2405.05347},
year = {2024}
}
备注
15 pages, 2 figures, 3 tables. Non-archival report presented at the NeurIPS'23 Workshop on Generative AI for Education (GAIED)