中文

Pearl:一个多模态的文化感知阿拉伯语指令数据集

计算与语言 2025-09-30 v3

摘要

主流的大型视觉语言模型(LVLMs)固有地编码了文化偏见,凸显了对多样化多模态数据集的需求。为了填补这一空白,我们引入了 PEARL,一个明确为文化理解而设计的大规模阿拉伯语多模态数据集和基准。PEARL 通过先进的智能体工作流和来自阿拉伯世界各地的 37 名标注者的大量人在回路标注构建而成,包含超过 309K 个多模态样本,涵盖覆盖所有阿拉伯国家的十个具有文化意义的领域。我们进一步提供了两个稳健的评估基准(PEARL 和 PEARL-LITE),以及一个专门为评估细微文化差异而明确开发的子集(PEARL-X)。对 SOTA 的开源和专有 LVLMs 的综合评估表明,与传统的缩放方法相比,以推理为中心的指令对齐显著改善了模型的文化基础。PEARL 为推进文化感知的多模态建模研究奠定了基础资源。所有数据集和基准均已公开。

关键词

引用

@article{arxiv.2505.21979,
  title  = {Pearl: A Multimodal Culturally-Aware Arabic Instruction Dataset},
  author = {Fakhraddin Alwajih and Samar M. Magdy and Abdellah El Mekki and Omer Nacar and Youssef Nafea and Safaa Taher Abdelfadil and Abdulfattah Mohammed Yahya and Hamzah Luqman and Nada Almarwani and Samah Aloufi and Baraah Qawasmen and Houdaifa Atou and Serry Sibaee and Hamzah A. Alsayadi and Walid Al-Dhabyani and Maged S. Al-shaibani and Aya El Aatar and Nour Qandos and Rahaf Alhamouri and Samar Ahmad and Mohammed Anwar Al-Ghrawi and Aminetou Yacoub and Ruwa AbuHweidi and Vatimetou Mohamed Lemin and Reem Abdel-Salam and Ahlam Bashiti and Aisha Alansari and Ahmed Ashraf and Nora Alturayeif and Alcides Alcoba Inciarte and Adel Ammar and Abdelrahim A. Elmadany and Mohamedou Cheikh Tourad and Ismail Berrada and Mustafa Jarrar and Shady Shehata and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2505.21979},
  year   = {2025}
}

备注

https://github.com/UBC-NLP/pearl