StudentEval:面向代码大语言模型的由学生编写提示词的基准
机器学习
2023-06-08 v1 人机交互
软件工程
摘要
代码大语言模型(Code LLM)正被快速部署,且有证据表明它们能提高专业程序员的效率。当前的代码生成基准衡量的是模型在给定专家提示词时能否生成正确程序。在本文中,我们提出一个新的基准,其中包含每个问题的多个提示词,由一类特定的非专家提示词编写群体——初学者程序员——所写。StudentEval 包含 48 个问题的 1,749 条提示词,由仅完成过一个学期 Python 编程课程的 80 名学生编写。我们的学生在与 Code LLM 交互式协作时写下了这些提示词,并且我们观察到成功率参差不齐。我们使用 StudentEval 评估了 5 个 Code LLM,发现 StudentEval 比现有基准更能区分模型性能。我们分析了这些提示词,发现学生的提示技巧存在显著差异。我们还发现,非确定性 LLM 采样可能误导学生,使其认为自己的提示词比实际更有效(或更无效),这对如何使用 Code LLM 进行教学具有启示意义。
引用
@article{arxiv.2306.04556,
title = {StudentEval: A Benchmark of Student-Written Prompts for Large Language Models of Code},
author = {Hannah McLean Babe and Sydney Nguyen and Yangtian Zi and Arjun Guha and Molly Q Feldman and Carolyn Jane Anderson},
journal= {arXiv preprint arXiv:2306.04556},
year = {2023}
}