中文

SaudiCulture:评估大语言模型在沙特阿拉伯文化情境下的文化能力基准

计算与语言 2025-03-25 v1 人工智能

摘要

大型语言模型(LLM)在自然语言处理领域展现出惊人的能力,但常常难以准确捕捉和反映文化细微差别。本研究聚焦沙特阿拉伯——一个具有多样方言和丰富文化传统的国家,致力于解决上述挑战。我们引入SaudiCulture,一个用于评估大语言模型在沙特阿拉伯特定地理与文化背景下文化能力的新颖基准测试。SaudiCulture涵盖五个主要地理区域(西部、东部、南部、北部和中部)的题目,以及适用于全国范围的常规问题,涉及食物、服饰、娱乐、节日庆祝和手工艺等广泛文化领域。为确保严格的评估,SaudiCulture包含不同复杂度的题目,包括开放式、单选和多选格式,部分题目需multiple correct answers。此外,数据集区分了常规文化知识与特定地区特性。我们对五个大语言模型(如GPT-4、Llama 3.3、FANAR、Jais和AceGPT)进行了广泛评估,分析了其在不同题目类型和文化情境下的表现。我们的发现表明,所有模型在面对高度专业化或地区特定问题时,尤其是需要multiple correct responses的题目,表现会显著下降。此外,某些文化类别比其他类别更容易被识别,进一步凸显了大语言模型在文化理解方面的不一致性。这些结果强调了将地区特定知识纳入大语言模型训练的重要性,以提升其文化能力。

关键词

引用

@article{arxiv.2503.17485,
  title  = {SaudiCulture: A Benchmark for Evaluating Large Language Models Cultural Competence within Saudi Arabia},
  author = {Lama Ayash and Hassan Alhuzali and Ashwag Alasmari and Sultan Aloufi},
  journal= {arXiv preprint arXiv:2503.17485},
  year   = {2025}
}

备注

34 pages, under-review