AraSTEM:面向评估大语言模型在 STEM 领域知识的阿拉伯语多选题基准
计算与语言
2025-01-03 v1 人工智能
摘要
大型语言模型(LLM)在生成类人文本方面展现出惊人的能力,同时在知识获取方面也表现突出。这凸显了超越典型自然语言处理下游基准测试,评估 LLM 各方面能力(包括知识和推理)的必要性。已developed众多基准测试以评估 LLM 知识,但它们主要聚焦于英语。鉴于许多 LLM 是多语言的,仅依赖英语知识基准测试已不足。为此,我们引入AraSTEM,一个新的阿拉伯语多选题数据集,旨在评估 LLM 在 STEM 领域的知识。该数据集涵盖多个主题和不同难度水平,要求模型展现对科学阿拉伯语的深入理解以取得高准确率。我们的发现表明,不同规模的公开模型在该数据集上表现不佳,这凸显了需要更多本地化语言模型的需求。该数据集已免费发布在 Hugging Face 上。
引用
@article{arxiv.2501.00559,
title = {AraSTEM: A Native Arabic Multiple Choice Question Benchmark for Evaluating LLMs Knowledge In STEM Subjects},
author = {Ahmad Mustapha and Hadi Al-Khansa and Hadi Al-Mubasher and Aya Mourad and Ranam Hamoud and Hasan El-Husseini and Marwah Al-Sakkaf and Mariette Awad},
journal= {arXiv preprint arXiv:2501.00559},
year = {2025}
}