中文

Whodunit: 分类代码是人类编写的还是由 GPT-4 生成——以 CodeChef 问题为例

软件工程 2024-03-08 v1

摘要

人工智能助手如 GitHub Copilot 和 ChatGPT 基于如 GPT-4 这样的大型语言模型正在革新编程任务的执行方式,引发关于代码是否由生成式 AI 模型编写的疑问。此类问题尤其引起教育者的关注,他们担心这些工具 enables 一种新形式的学术不端,即学生提交 AI 生成的代码作为自己的作品。我们的研究探讨了使用代码风格学派和机器学习来区分 GPT-4 生成和人类编写代码的可行性。我们的数据集包括来自 CodeChef 的人类编写解决方案和由 GPT-4 生成的 AI 编写解决方案。我们的分类器超越基线,F1 分数和 AUC-ROC 分数分别为 0.91。我们分类器的一个变体排除了可游戏特征(如空行、空白),仍表现良好,F1 分数和 AUC-ROC 分数分别为 0.89。我们还评估了分类器在编程问题难度上的表现,发现较易和中等难度问题之间几乎没有差异,分类器在更难的问题上仅稍差。我们的研究表明,代码风格学派是区分 GPT-4 生成代码和人类编写代码的有前景的做法。

关键词

引用

@article{arxiv.2403.04013,
  title  = {Whodunit: Classifying Code as Human Authored or GPT-4 Generated -- A case study on CodeChef problems},
  author = {Oseremen Joy Idialu and Noble Saji Mathews and Rungroj Maipradit and Joanne M. Atlee and Mei Nagappan},
  journal= {arXiv preprint arXiv:2403.04013},
  year   = {2024}
}

备注

13 pages, 5 figures, MSR Conference