CROPE:评估视觉语言模型在文化特定概念上的情境适应能力
计算与语言
2025-02-07 v2 计算机视觉与模式识别
摘要
随着视觉语言模型(Vision and Language models, VLMs) reaching users across the globe(跨越全球的用户),对其文化理解能力的评估已成为关键挑战。本文引入 CROPE,一个旨在探测文化特定概念知识并评估通过情境信息进行文化适应能力的视觉问答基准测试。通过这种方式,我们能够区分在训练期间获得的参数化知识与在推理期间通过视觉和文本描述提供的情境知识。我们评估了多个最新开源 VLMs,发现在参数化设置下,文化特定概念与常见概念之间存在显著的性能差异。此外,针对情境知识的实验表明,模型在有效利用多模态信息和将文化特定概念绑定到其图示方面存在挑战。我们的发现揭示了当前 VLMs 在文化理解和适应性方面的局限性,这些局限性需要被 addressed,以实现更具包容性的文化模型。
引用
@article{arxiv.2410.15453,
title = {CROPE: Evaluating In-Context Adaptation of Vision and Language Models to Culture-Specific Concepts},
author = {Malvina Nikandrou and Georgios Pantazopoulos and Nikolas Vitsakis and Ioannis Konstas and Alessandro Suglia},
journal= {arXiv preprint arXiv:2410.15453},
year = {2025}
}