视觉语言模型的文化意识程度如何?
计算机视觉与模式识别
2025-02-11 v2 人工智能
计算与语言
机器学习
摘要
一张图像通常被认为胜过千言万语,某些图像可以讲述丰富而深刻的故事。这些故事能通过图像描述来讲述吗?神话、民间舞蹈、文化标志和符号等民俗体裁的图像对每种文化都至关重要。我们的研究比较了四种流行的视觉语言模型(GPT-4V、Gemini Pro Vision、LLaVA 和 OpenFlamingo)在此类图像中识别特定文化信息并生成准确且具有文化敏感性的图像描述的性能。我们还提出了一种新的评估指标——文化意识得分(CAS),用于衡量图像描述中的文化意识程度。我们提供了一个带有真值标注的 MOSAIC-1.5k 数据集,包含文化背景和上下文的图像,以及一个分配了文化意识得分的标注数据集,可与未见数据一起使用。生成具有文化适宜性的图像描述对科学研究很有价值,并有益于许多实际应用。我们设想我们的工作将促进全球 AI 应用对文化敏感性的更深层整合。通过向公众公开数据集和文化意识得分,我们旨在促进该领域的进一步研究,鼓励开发更多尊重并颂扬全球多样性的、具有文化意识的 AI 系统。
引用
@article{arxiv.2405.17475,
title = {How Culturally Aware are Vision-Language Models?},
author = {Olena Burda-Lassen and Aman Chadha and Shashank Goswami and Vinija Jain},
journal= {arXiv preprint arXiv:2405.17475},
year = {2025}
}