面向编程教育的生成式AI:ChatGPT、GPT-4与人类导师的基准评测
计算机与社会
2023-08-02 v3 人工智能
计算与语言
摘要
生成式AI与大型语言模型有望通过驱动面向编程入门教育的下一代教育技术来提升计算教育。近期研究已针对编程教育相关的不同场景探讨了这些模型;然而,这些工作存在若干局限,通常仅考虑已过时模型或仅特定场景。因此,缺乏针对全面编程教育场景对最先进模型进行系统基准评测的研究。在我们的工作中,我们系统评估了ChatGPT(基于GPT-3.5)与GPT-4两个模型,并在多种场景下将其表现与人类导师进行比较。我们使用五道Python编程入门题目以及来自某在线平台的真实错误程序进行评估,并基于专家标注评判表现。结果表明,GPT-4大幅优于ChatGPT(基于GPT-3.5),且在多个场景下接近人类导师表现。这些结果也凸显了GPT-4仍吃力的设置,为开发改进这些模型性能的技术提供了令人振奋的未来方向。
引用
@article{arxiv.2306.17156,
title = {Generative AI for Programming Education: Benchmarking ChatGPT, GPT-4, and Human Tutors},
author = {Tung Phung and Victor-Alexandru Pădurean and José Cambronero and Sumit Gulwani and Tobias Kohn and Rupak Majumdar and Adish Singla and Gustavo Soares},
journal= {arXiv preprint arXiv:2306.17156},
year = {2023}
}
备注
This article is a full version of the poster (extended abstract) from ICER'23