中文

超越英语:评估大语言模型在阿拉伯语语法纠错中的表现

计算与语言 2023-12-15 v1 人工智能

摘要

经过微调以遵循人类指令的大语言模型(LLMs)最近在各种英语自然语言处理任务中展现出了显著的能力。然而,它们在语法纠错(GEC)方面的表现,尤其是在英语以外的语言上,仍然在很大程度上未被探索。在这项工作中,我们评估了指令微调的大语言模型在阿拉伯语语法纠错中的能力,由于阿拉伯语丰富的形态学,这是一项复杂的任务。我们的研究结果表明,各种提示方法,结合(上下文)少样本学习,展现出了相当大的有效性,GPT-4 在专家提示下达到了高达 65.4965.49 的 F1_{1} 分数(比我们建立的基线高出约 55 个百分点)。尽管有这些积极的结果,我们发现指令微调的模型,无论其规模大小,其表现仍然不如完全微调的模型,即使后者规模小得多。这种差距凸显了大语言模型仍有巨大的改进空间。受低资源机器翻译中使用的方法启发,我们还开发了一种利用合成数据的方法,该方法在两个标准阿拉伯语基准测试上显著优于先前的模型。我们最好的模型在阿拉伯语语法纠错上达到了新的最优性能(SOTA),在 2014 年和 2015 年的 QALB 数据集上分别取得了 73.2973.2973.2673.26 的 F1_{1} 分数,优于同行评审的已发表基线。

关键词

引用

@article{arxiv.2312.08400,
  title  = {Beyond English: Evaluating LLMs for Arabic Grammatical Error Correction},
  author = {Sang Yun Kwon and Gagan Bhatia and El Moatez Billah Nagoudi and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2312.08400},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2308.04492