中文

AraDiCE:面向大语言模型的方言与文化能力基准评测集

计算与语言 2024-12-19 v3 人工智能

摘要

阿拉伯语以其丰富的方言多样性,在大语言模型中仍然严重代表性不足,尤其是在方言变体方面。我们通过引入七个方言合成数据集以及现代标准阿拉伯语(MSA)来弥补这一差距,这些数据集使用机器翻译(MT)结合人工后期编辑创建。我们提出了 AraDiCE,一个用于阿拉伯语方言和文化评估的基准。我们评估了大语言模型在方言理解和生成方面的能力,特别关注低资源阿拉伯语方言。此外,我们引入了首个细粒度基准,旨在评估海湾、埃及和黎凡特地区的文化意识,为大语言模型评估提供了一个新的维度。我们的研究结果表明,尽管像 Jais 和 AceGPT 这样的阿拉伯语专用模型在方言任务上优于多语言模型,但在方言识别、生成和翻译方面仍存在重大挑战。这项工作贡献了约 45K 个后期编辑样本和一个文化基准,并强调了定制化训练对于提升大语言模型捕捉多样阿拉伯语方言和文化语境细微差别的重要性。我们已发布本研究中开发的方言翻译模型和基准(https://huggingface.co/datasets/QCRI/AraDiCE)。

关键词

引用

@article{arxiv.2409.11404,
  title  = {AraDiCE: Benchmarks for Dialectal and Cultural Capabilities in LLMs},
  author = {Basel Mousi and Nadir Durrani and Fatema Ahmad and Md. Arid Hasan and Maram Hasanain and Tameem Kabbani and Fahim Dalvi and Shammur Absar Chowdhury and Firoj Alam},
  journal= {arXiv preprint arXiv:2409.11404},
  year   = {2024}
}

备注

Benchmarking, Culturally Informed, Large Language Models, Arabic NLP, LLMs, Arabic Dialect, Dialectal Benchmarking