中文

利用 GPT-4 增广不平衡数据以用于自动评分

计算与语言 2024-09-09 v3 人工智能 计算机与社会

摘要

基于机器学习的自动评分面临各评分类别中学生作答不平衡的挑战。为此,我们引入了一种新颖的文本数据增广框架,利用生成式大语言模型 GPT-4,专为自动评分中的不平衡数据集定制。我们的实验数据集包含学生对四个科学题目的书面作答。我们为 GPT-4 设计提示以生成作答,尤其是少数评分类别的作答,从而增广数据集。然后我们基于增广和原始数据集微调 DistillBERT 进行自动评分。使用准确率、精确率、召回率和 F1 指标评估模型性能。我们的发现表明,引入 GPT-4 增广数据显著提升了模型性能,尤其是精确率和 F1 分数。有趣的是,提升程度因具体数据集和所用增广数据比例而异。值得注意的是,我们发现需要不同量的增广数据(20%–40%)才能获得自动评分的稳定提升。与基于额外学生书面作答训练的模型比较表明,GPT-4 增广模型可与基于学生数据训练的模型媲美。本研究强调了利用 GPT-4 等生成式大语言模型的数据增广技术在解决自动评估中不平衡数据集方面的潜力与有效性。

关键词

引用

@article{arxiv.2310.18365,
  title  = {Using GPT-4 to Augment Unbalanced Data for Automatic Scoring},
  author = {Luyang Fang and Gyeong-Geon Lee and Xiaoming Zhai},
  journal= {arXiv preprint arXiv:2310.18365},
  year   = {2024}
}