中文

阿拉伯语 Qiyas 基准:衡量 ChatGPT 在数学与语言理解方面的能力

计算与语言 2024-07-02 v1 人工智能

摘要

尽管阿拉伯语作为全球语言的重要性日益提升,但目前缺乏仅基于阿拉伯语数据预训练的语言模型。这导致可用于评估阿拉伯语语言模型性能的基准测试数量有限。为填补这一空白,我们引入了两个新建基准,旨在评估模型在阿拉伯语中的数学推理和语言理解能力。这两个基准源自称为 Qiyas 的通用 aptitude 测试(GAT),这是在沙特阿拉伯大学 admissions 中广泛使用的标准化测试。为验证目的,我们评估了 ChatGPT-3.5-trubo 和 ChatGPT-4 在基准中的表现。我们的发现表明,这些基准提出了重大挑战,ChatGPT-4 在 Qiyas 基准中实现整体平均准确率为64%,而 ChatGPT-3.5-trubo在各种问题类型上的整体准确率为49%。我们相信,这些基准的发布将为提升面向低资源阿拉伯语语言的未来模型的数学推理和语言理解能力铺平道路。

关键词

引用

@article{arxiv.2407.00146,
  title  = {The Qiyas Benchmark: Measuring ChatGPT Mathematical and Language Understanding in Arabic},
  author = {Shahad Al-Khalifa and Hend Al-Khalifa},
  journal= {arXiv preprint arXiv:2407.00146},
  year   = {2024}
}