LLM 在阿拉伯语作文评分中的表现如何?
计算与语言
2025-01-29 v1 人工智能
摘要
本研究评估了包括 ChatGPT、Llama、Aya、Jais 和 ACEGPT 在内的最先进的大型语言模型(LLM)在使用 AR-AES 数据集进行阿拉伯语自动作文评分(AES)任务中的有效性。研究探索了各种评估方法,包括零样本、上下文少样本学习和微调,并通过在提示词中加入评分指南来考察指令遵循能力的影响。为了提高模型的理解能力和性能,实施了一种混合语言提示策略,将英文提示与阿拉伯语内容相结合。在测试的模型中,ACEGPT 在该数据集上表现出最佳性能,二次加权 Kappa(QWK)达到 0.67,但仍被一个较小的基于 BERT 的模型(QWK 为 0.88)超越。该研究指出了 LLM 在处理阿拉伯语时面临的挑战,包括分词复杂性和更高的计算需求。不同课程间的性能差异凸显了对能够处理多样化评估格式的自适应模型的需求,并强调了有效的提示工程对改善 LLM 输出的积极影响。据我们所知,本研究是首次使用真实学生数据对多个生成式大型语言模型(LLM)在阿拉伯语作文上的性能进行实证评估。
引用
@article{arxiv.2501.16516,
title = {How well can LLMs Grade Essays in Arabic?},
author = {Rayed Ghazawi and Edwin Simpson},
journal= {arXiv preprint arXiv:2501.16516},
year = {2025}
}
备注
18 pages