大型语言模型能否自动对书面文章进行熟练度评分?
计算与语言
2024-04-17 v2 人工智能
摘要
尽管在过去 50 年中提出了多种方法来解决自动作文评分(AES)问题,但在有效性方面仍有诸多不足。大型语言模型(LLM)是基于 Transformer 的模型,在各类任务中展现出了非凡的能力。在本文中,鉴于 LLM 强大的语言知识,我们测试了它们分析和有效评阅书面文章的能力。我们实验了两种流行的 LLM,即 ChatGPT 和 Llama。我们旨在检验这些模型能否完成该任务,如果能,它们在整体和单个写作特征两个层面上与 state-of-the-art(SOTA)模型相比性能如何。我们在设计四种不同的提示时运用了提示工程策略,以使其在该任务中发挥最大潜力。我们在 ASAP 数据集上进行的实验揭示了几项有趣的观察结果。首先,选择正确的提示高度依赖于模型和任务性质。其次,这两个 LLM 在 AES 中表现出相当的平均性能,ChatGPT 略有优势。最后,尽管这两个 LLM 与 SOTA 模型在预测性能上存在差距,但它们提供的反馈有助于提升文章质量,这可能对教师和学生都有所帮助。
引用
@article{arxiv.2403.06149,
title = {Can Large Language Models Automatically Score Proficiency of Written Essays?},
author = {Watheq Mansour and Salam Albatarni and Sohaila Eltanbouly and Tamer Elsayed},
journal= {arXiv preprint arXiv:2403.06149},
year = {2024}
}
备注
V2 (published version of LREC-COLING 2024)