中文

CamelEval:推动阿拉伯语言模型及基准测试的文化对齐

计算与语言 2024-09-25 v2 人工智能

摘要

大型语言模型(LLMs)是现代人工智能系统的基石。本文引入Juhaina,一款专为符合阿拉伯语使用者价值观与偏好而设计的阿拉伯-英语双语LLM。Juhaina内置支持指令遵循、开放式问答、信息提供和文本处理等高级功能。该模型包含9.24亿参数,训练时使用最长上限为8192个token的上下文窗口。本文详细阐述了Juhaina的创建过程,并提供了广泛的实证评估。此外,我们识别了广泛采用的Open Arabic LLM Leaderboard(OALL)的局限性,并提出了新的评估基准CamelEval。我们的发现表明,Juhaina在生成阿拉伯语有用响应、提供地区准确信息以及理解细致的文化方面,优于Llama和Gemma等同等规模的现有LLM。我们期望Juhaina能够民主化前沿AI技术,为4亿以上阿拉伯语使用者提供LLM,这些LLM不仅能以其语言交流,还能理解其文化。我们已在Huggingface公开发布所有模型,链接为\url{https://huggingface.co/elmrc}。

关键词

引用

@article{arxiv.2409.12623,
  title  = {CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks},
  author = {Zhaozhi Qian and Faroq Altam and Muhammad Alqurishi and Riad Souissi},
  journal= {arXiv preprint arXiv:2409.12623},
  year   = {2024}
}