微调 ChatGPT 用于自动评分
计算与语言
2023-12-27 v3 人工智能
摘要
本研究展示了使用科学教育中的示例评估任务,微调 ChatGPT (GPT-3.5) 来自动评分学生书面建构性回答的潜力。近期关于 OpenAI 生成模型 GPT-3.5 的研究证明了其在以高准确度和类人回答预测自然语言方面的优越性。GPT-3.5 已在海量在线语言材料(如期刊和维基百科)上训练;因此,由于学生使用的语言与训练材料不同,自动评分所需的不仅仅是直接使用预训练 GPT-3.5。这意味着在特定任务数据上微调的域特定模型可提升模型性能。在本研究中,我们基于包含中学和高中生回答及专家评分的多样化数据集,对 GPT-3.5 在六项评估任务上进行了微调。这六项任务包括两个多标签和四个多类评估任务。我们将微调 GPT-3.5 的性能与微调的最先进 Google 生成语言模型 BERT 进行比较。结果显示,由科学问题和回答构建的 BERT 域内训练语料平均准确率为 0.838,标准差为 0.069。GPT-3.5 在六项任务上自动评分准确率显著提升 (9.1%)(均值 = 9.15,标准差 = 0.042),p = 0.001 < 0.05。具体而言,对于多标签任务(条目 1 含 5 个标签;条目 2 含 10 个标签),GPT-3.5 在所有标签上的评分准确率均显著高于 BERT,其中第二个条目提升了 7.1%。GPT-3.5 在四个多类条目上的平均评分提升相较 BERT 为 10.6%。我们的研究证实了微调 GPT-3.5 在教育领域特定数据上以高准确度自动评分学生回答的有效性。我们已发布微调模型供公众使用和社区参与。
引用
@article{arxiv.2310.10072,
title = {Fine-tuning ChatGPT for Automatic Scoring},
author = {Ehsan Latif and Xiaoming Zhai},
journal= {arXiv preprint arXiv:2310.10072},
year = {2023}
}
备注
Submitted to Computers and Education: Artificial Intelligence