中文

大型语言模型能否考得好?对 LLM 评估短答题能力的实证研究

计算与语言 2024-05-07 v1 人工智能

摘要

本文报告了一系列实验结果,旨在评估大型语言模型(LLM)在对短答题进行评分(即打分)方面的能力。 Specifically,我们探讨了不同GPT版本和提示工程策略在对来自Carousel平台的全新数据集中,对不同学科(科学和历史)和年级水平(覆盖5-16岁)的短答题进行真实学生答案评分的表现。我们发现,GPT-4在基本的few-shot提示下表现良好(Kappa, 0.70),且重要的是,非常接近人类水平性能(0.75)。该研究建立在先前发现GPT-4能够可靠地对短答题阅读理解问题进行评分,性能水平非常接近专家人类评分员的基础上。这种接近人类水平的性能,在各种学科和年级水平上表明,LLM可能是支持K-12教育中低风险形成性评估任务的有价值工具,并且对实际教育交付具有重要影响。

关键词

引用

@article{arxiv.2405.02985,
  title  = {Can Large Language Models Make the Grade? An Empirical Study Evaluating LLMs Ability to Mark Short Answer Questions in K-12 Education},
  author = {Owen Henkel and Adam Boxer and Libby Hills and Bill Roberts},
  journal= {arXiv preprint arXiv:2405.02985},
  year   = {2024}
}