中文

GemmAr:通过阿拉伯指令调优提升LLM性能

计算与语言 2024-07-10 v2 人工智能

摘要

大型语言模型(LLMs)在自然语言处理(NLP)领域取得了很大成就,尤其是在英语语言上。这些模型在理解和生成类人文本方面都表现出色。语言模型的成功很大程度上取决于高质量指令数据集的可用性,这些数据集包含详细的任务描述和相应的响应,对训练模型以准确方式回应各种提示至关重要。然而,这些资源的可用性和质量因语言而异。虽然模型在英语方面表现良好,但在诸如阿拉伯语等语言上往往需要帮助,因为缺乏针对阿拉伯语特定任务的微调数据集。为此,我们引入了InstAr-500k,一个新的阿拉伯语指令数据集,通过生成和收集覆盖多个领域和指令类型的内容来创建。我们通过在多个下游任务上对开源Gemma-7B模型进行微调来评估该数据集,以提高其功能。根据多项评估,我们的微调模型在多个阿拉伯语NLP基准测试中取得优异性能。这些结果强调了我们数据集在提升阿拉伯语语言模型能力方面的有效性。我们的指令数据集通过提供能够放大阿拉伯语NLP发展的资源,弥合了英语和阿拉伯语语言模型之间性能差距。基于这一基础,我们开发了一个专为在广泛范围的阿拉伯语NLP任务中取得优异性能而打磨的模型,称为GemmAr-7B-V1。

关键词

引用

@article{arxiv.2407.02147,
  title  = {GemmAr: Enhancing LLMs Through Arabic Instruction-Tuning},
  author = {Hasna Chouikhi and Manel Aloui and Cyrine Ben Hammou and Ghaith Chaabane and Haithem Kchaou and Chehir Dhaouadi},
  journal= {arXiv preprint arXiv:2407.02147},
  year   = {2024}
}