大语言模型能否批改短答阅读理解题:基于新颖数据集的实证研究
计算与语言
2024-05-07 v2 人工智能
摘要
开放式问题要求学生给出多词、非平凡回答,是形成性评估的常用工具,因为它能更具体地揭示学生的已知与未知。然而,批改开放式问题耗时颇多,导致教师转而使用更简单的题型或减少形成性评估次数。尽管自动化短答评分(ASAG)长期受关注,但以往方法技术复杂,限制了其在形成性评估中的应用。新一代大语言模型(LLM)有可能使短答评分更为可行。本文从两方面探讨最新 LLM 用于 ASAG、特别是形成性评估短答评分的潜力。首先,引入一个新颖的短答阅读理解题数据集,来源于在加纳超过 150 名学生中开展的阅读评估。该数据集可在新语境下评估 LLM,因它们主要基于北美高收入国家数据设计与训练。其次,本文实证评估了多种生成式 LLM 配置相比专家人类评分员对学生短答的评分表现。结果表明,GPT-4 仅需极少提示工程,即在该新颖数据集上表现极佳(QWK 0.92,F1 0.89),接近专家人类评分员水平。据我们所知,这是首项使用真实学生数据对生成式 LLM 在短答阅读理解题上的表现进行实证评估、且达成该表现技术门槛很低的工作。这些发现表明生成式 LLM 可用于批改形成性读写评估任务。
引用
@article{arxiv.2310.18373,
title = {Can LLMs Grade Short-Answer Reading Comprehension Questions : An Empirical Study with a Novel Dataset},
author = {Owen Henkel and Libby Hills and Bill Roberts and Joshua McGrane},
journal= {arXiv preprint arXiv:2310.18373},
year = {2024}
}