大语言模型与阿拉伯语内容:综述
摘要
过去三年里,大语言模型(LLMs)的快速发展在人工智能领域产生了深远影响,尤其是在自然语言处理(NLP)中涵盖多种语言,包括阿拉伯语。尽管阿拉伯语是阿拉伯世界 27 个国家中最广泛使用的语言之一,并且在一些非阿拉伯语国家也常作为第二语言使用,但阿拉伯语资源、数据集和工具仍然匮乏。由于阿拉伯语的复杂形态、复杂结构和多样书写标准等因素,阿拉伯语 NLP 任务面临诸多挑战。研究人员正在积极应对这些挑战,表明在多语言语料库上训练的预训练大语言模型(LLMs)在各种阿拉伯语 NLP 任务中取得显著成功。本研究概述了大语言模型用于阿拉伯语的应用,概述了各种 NLP 应用中的早期预训练阿拉伯语语言模型,以及其处理多样化阿拉伯语内容和方言的能力。它还概述了如何通过微调和提示工程来提高这些模型的性能。此外,本研究总结了常见的阿拉伯语基准和数据集,呈现我们关于 LLM 采用趋势持续上升的观察。
引用
@article{arxiv.2505.08004,
title = {Large Language Models and Arabic Content: A Review},
author = {Haneh Rhel and Dmitri Roussinov},
journal= {arXiv preprint arXiv:2505.08004},
year = {2025}
}
备注
Original language: English This paper has been submitted to the First International Conference on Artificial Intelligence and Generative AI (FICAILY 2025), and it has been accepted for presentation at FICAILY on 9-10/July 2025 and for publication in the Springer Nature. Number of pages: 16 Publication status Accepted/In press - 7 Apr 2025 https://www.gena-ai-libya2025.com/