中文

EgMM-Corpus:面向埃及文化的多模态视觉-语言数据集

计算与语言 2025-10-21 v1

摘要

尽管近期的人工智能进展显著,但多模态文化多样化数据集仍有限,尤其是中东和非洲地区。本文引入 EgMM-Corpus,一个专为埃及文化而设计的多模态数据集。通过设计并运行全新的数据收集管道,我们收集了超过 3000 张图片,涵盖 313 个概念,包括地标、食物和民间故事。数据集中的每一条目都经过人工验证,以确保文化真实性和多模态一致性。EgMM-Corpus旨�为在埃及文化背景下评估和训练视觉-语言模型提供可靠资源。我们进一步评估了 Contrastive Language-Image Pre-training CLIP 在 EgMM-Corpus 上的零样本性能,其在分类任务中 Top-1 准确率达 21.2%,Top-5 准确率达 36.4%。这些结果凸显了大规模视觉-语言模型中现存的文化偏见,表明 EgMM-Corpus 作为开发文化感知模型的基准基准的重要性。

关键词

引用

@article{arxiv.2510.16198,
  title  = {EgMM-Corpus: A Multimodal Vision-Language Dataset for Egyptian Culture},
  author = {Mohamed Gamil and Abdelrahman Elsayed and Abdelrahman Lila and Ahmed Gad and Hesham Abdelgawad and Mohamed Aref and Ahmed Fares},
  journal= {arXiv preprint arXiv:2510.16198},
  year   = {2025}
}