中文

JEEM:四种阿拉伯方言上的视觉语言理解

计算与语言 2025-03-31 v1 人工智能

摘要

我们介绍JEEM,这是一个基准测试,旨在评估视觉语言模型(VLM)在四个阿拉伯语国家(约旦、阿联酋、埃及和摩洛哥)上视觉理解能力。JEEM包括图像描述和视觉问答任务,具有文化丰富且区域多样化的内容。该数据集旨在评估VLM在方言间的泛化能力,以及其准确解释视觉语境中文化元素的能力。在对五大流行开源阿拉伯语VLM和GPT-4V进行评估后,我们发现阿拉伯语VLM始终表现不佳,无论是在视觉理解还是方言特定生成方面都面临挑战。尽管GPT-4V在这一比较中排名最佳,但该模型的语言能力在不同方言之间存在差异,其视觉理解能力也落后于期望。这凸显了需要更包容性模型以及文化多样化评估范式的重要性。

关键词

引用

@article{arxiv.2503.21910,
  title  = {JEEM: Vision-Language Understanding in Four Arabic Dialects},
  author = {Karima Kadaoui and Hanin Atwany and Hamdan Al-Ali and Abdelrahman Mohamed and Ali Mekky and Sergei Tilga and Natalia Fedorova and Ekaterina Artemova and Hanan Aldarmaki and Yova Kementchedjhieva},
  journal= {arXiv preprint arXiv:2503.21910},
  year   = {2025}
}