中文

衡量视觉语言模型的文化理解能力

计算机视觉与模式识别 2024-10-15 v3 人工智能 计算与语言

摘要

基础模型和视觉语言预训练显著推进了视觉语言模型(VLM),使其能够处理视觉和语言数据的多模态。然而,其性能通常仅在一般场景理解——识别物体、属性和动作——方面得到评估,而非文化理解。本研究引入CulturalVQA,一个旨在评估VLM地理多样性文化理解的视觉问答基准。我们收集了2378个图像-问题对,每个问题包含1-5个答案,代表来自5大洲11个国家的文化。问题探讨了文化各个方面,如服饰、食物、饮料、仪式和传统。对CulturalVQA上的VLM进行基准测试,包括GPT-4V和Gemini,揭示了其在不同地区的文化理解能力存在差异,北美的文化理解能力较强,而非洲的文化理解能力显著较低。我们观察到其在不同文化方面的表现也存在差异,服饰、仪式和传统的表现高于食物和饮料。这些差异帮助我们识别VLM在文化理解方面的不足之处,展示了CulturalVQA作为衡量VLM在理解多样文化方面进展的全面评估集的潜力。

关键词

引用

@article{arxiv.2407.10920,
  title  = {Benchmarking Vision Language Models for Cultural Understanding},
  author = {Shravan Nayak and Kanishk Jain and Rabiul Awal and Siva Reddy and Sjoerd van Steenkiste and Lisa Anne Hendricks and Karolina Stańczak and Aishwarya Agrawal},
  journal= {arXiv preprint arXiv:2407.10920},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 Main Conference