3LM:桥接阿拉伯语、STEM与代码的基准测试
计算与语言
2025-07-28 v3
摘要
阿拉伯语是全球使用最广的语言之一,但为其开发和评估大语言模型(LLM)的努力相对有限。现有大多数阿拉伯语基准测试聚焦于语言、文化或宗教内容,在STEM和代码等领域存在显著空白,而这些领域对实际应用的LLM至关重要。为填补这一空白,我们提出3LM,一套专为阿拉伯语设计的三个基准测试套件。第一个由阿拉伯语教科书和教育练习册中自然来源的STEM相关问答对组成。第二个包含使用相同来源生成的合成STEM问题。第三个基准测试聚焦代码生成,通过仔细翻译两个广泛使用的代码基准测试构建,纳入多轮人类审核以确保高质量和忠实翻译。我们公开发布所有三个基准测试,以支持阿拉伯语言LLM研究在这些关键但被低估的领域的发展。
引用
@article{arxiv.2507.15850,
title = {3LM: Bridging Arabic, STEM, and Code through Benchmarking},
author = {Basma El Amel Boussaha and Leen AlQadi and Mugariya Farooq and Shaikha Alsuwaidi and Giulia Campesan and Ahmed Alzubaidi and Mohammed Alyafeai and Hakim Hacid},
journal= {arXiv preprint arXiv:2507.15850},
year = {2025}
}