中文

从指南到实践:阿拉伯语语言模型评估的新范式

计算与语言 2025-06-03 v1

摘要

本文通过建立全面的理论指南并引入一种新颖的评估框架,解决了阿拉伯语语言模型评估中的关键空白。我们首先分析了现有的阿拉伯语评估数据集,识别出在语言准确性、文化契合度以及方法论严谨性方面的重大问题。为了解决 LLM 中的这些局限性,我们提出了 Arabic Depth Mini Dataset (ADMD),这是一个精心策划的包含 490 个具有挑战性的问题的集合,涵盖十个主要领域(42 个子领域,见图 1)。使用 ADMD,我们评估了五个领先的语言模型:GPT-4、Claude 3.5 Sonnet、Gemini Flash 1.5、CommandR 100B 和 Qwen-Max。我们的结果显示,不同领域的模型性能存在显著差异,在需要深厚文化理解和专业知识的领域面临特殊挑战。Claude 3.5 Sonnet 以 30% 的最高总体准确率表现最佳,在阿拉伯语数学理论、阿拉伯语语言和伊斯兰领域显示出相对优势。这项工作为改进阿拉伯语语言模型评估提供了理论基础和实践见解,强调了文化能力与技术能力同等重要。

关键词

引用

@article{arxiv.2506.01920,
  title  = {From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation},
  author = {Serry Sibaee and Omer Nacar and Adel Ammar and Yasser Al-Habashi and Abdulrahman Al-Batati and Wadii Boulila},
  journal= {arXiv preprint arXiv:2506.01920},
  year   = {2025}
}