中文

从本土概念到普遍概念:评估视觉语言模型的多文化理解

计算与语言 2024-07-02 v1 人工智能 计算机视觉与模式识别

摘要

尽管近期在视觉语言模型方面取得了进展,但这些模型在来自非西方文化的图像上的表现仍然不佳,这是由于训练数据集中对非西方文化的代表性不足。已提出 various benchmarks 来测试模型的文化包容性,但这些基准对文化覆盖范围有限,且不足够评估模型在普遍概念以及特定于文化的本土概念上的文化多样性。为此,我们提出 GlobalRG 基准,包含两个具有挑战性的任务:跨普遍概念检索和文化视觉锚定。前者任务涉及从 50 个国家检索具有文化多样性的图像以匹配普遍概念,而后者任务旨在将特定于文化的概念锚定到来自 15 个国家的图像中。我们对广泛的模型进行评估,结果显示模型在不同文化之间的表现存在显著差异——这凸显了在视觉语言模型中增强多文化理解的必要性。

关键词

引用

@article{arxiv.2407.00263,
  title  = {From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language Models},
  author = {Mehar Bhatia and Sahithya Ravi and Aditya Chinchure and Eunjeong Hwang and Vered Shwartz},
  journal= {arXiv preprint arXiv:2407.00263},
  year   = {2024}
}

备注

Under peer review