超越英语:评估大语言模型在阿拉伯语语法纠错中的表现
计算与语言
2023-12-15 v1 人工智能
摘要
经过微调以遵循人类指令的大语言模型(LLMs)最近在各种英语自然语言处理任务中展现出了显著的能力。然而,它们在语法纠错(GEC)方面的表现,尤其是在英语以外的语言上,仍然在很大程度上未被探索。在这项工作中,我们评估了指令微调的大语言模型在阿拉伯语语法纠错中的能力,由于阿拉伯语丰富的形态学,这是一项复杂的任务。我们的研究结果表明,各种提示方法,结合(上下文)少样本学习,展现出了相当大的有效性,GPT-4 在专家提示下达到了高达 的 F 分数(比我们建立的基线高出约 个百分点)。尽管有这些积极的结果,我们发现指令微调的模型,无论其规模大小,其表现仍然不如完全微调的模型,即使后者规模小得多。这种差距凸显了大语言模型仍有巨大的改进空间。受低资源机器翻译中使用的方法启发,我们还开发了一种利用合成数据的方法,该方法在两个标准阿拉伯语基准测试上显著优于先前的模型。我们最好的模型在阿拉伯语语法纠错上达到了新的最优性能(SOTA),在 2014 年和 2015 年的 QALB 数据集上分别取得了 和 的 F 分数,优于同行评审的已发表基线。
引用
@article{arxiv.2312.08400,
title = {Beyond English: Evaluating LLMs for Arabic Grammatical Error Correction},
author = {Sang Yun Kwon and Gagan Bhatia and El Moatez Billah Nagoudi and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2312.08400},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2308.04492