大型语言模型是优秀的作文评分者吗?
计算与语言
2024-09-23 v1 人工智能
计算机与社会
摘要
我们评估了大型语言模型(LLM)在评估作文质量方面的有效性,重点关注其与人类评分的一致性。更准确地说,我们在自动作文评分(AES)任务中评估了 ChatGPT 和 Llama,这是教育领域一个至关重要的自然语言处理(NLP)应用。我们考虑了零样本和少样本学习以及不同的提示方法。我们利用 ASAP 数据集(AES 任务的一个知名基准)将 LLM 提供的数字评分与人类评分员提供的分数进行了比较。我们的研究表明,与人类评分员提供的分数相比,这两个 LLM 通常给出较低的分数;此外,这些分数与人类提供的分数相关性不强。特别是,与 Llama 相比,ChatGPT 往往更严格,并且与人类评估的偏差更大。我们还实验了以前 AES 方法常用的一些作文特征,这些特征与长度、连接词和过渡词的使用以及可读性指标有关,包括拼写和语法错误的数量。我们发现,总体而言,这些特征均未与人类或 LLM 的分数表现出强相关性。最后,我们报告了 Llama 3 的结果,正如预期的那样,其在各方面均表现更好。总体而言,虽然 LLM 似乎不足以替代人类评分,但我们的结果对于未来将其用作辅助人类进行书面作文评分的工具具有一定的鼓励作用。
引用
@article{arxiv.2409.13120,
title = {Are Large Language Models Good Essay Graders?},
author = {Anindita Kundu and Denilson Barbosa},
journal= {arXiv preprint arXiv:2409.13120},
year = {2024}
}