GIMMICK——全球包容性多模态多任务文化知识基准测试
计算与语言
2025-02-20 v1
摘要
大型视觉语言模型(Large Vision-Language Models, LVLMs)近期因其卓越的性能和广泛的适用性而备受关注。尽管先前已表明其在涉及非西方语境的使用场景中的效果有所不足,但现有研究在范围上存在局限,仅涵盖狭窄的文化范围,仅关注少数文化方面,或仅在单一任务上评估有限的模型选择。为了推动全球包容性的LVLM研究,我们引入了GIMMICK,这是一个广泛的多模态基准,旨在评估代表六个全球宏观区域的144个国家的广泛文化知识谱系。GIMMICK包含基于三个新数据集构建的六个任务,涵盖728个独特的文化事件或方面,我们在其上评估了20个LVLM和11个LLM,包括五个专有模型和26个各种规模的开源权重模型。我们系统地考察了(1)区域文化偏差,(2)模型规模的影响,(3)输入模态,以及(4)外部线索。我们的分析揭示了各模型和任务中对西方文化的强烈偏差,并突出了模型规模与性能之间的强相关性,以及多模态输入和外部地理线索的有效性。我们进一步发现,模型对有形方面比无形方面(例如,食物与仪式)拥有更多知识,并且它们擅长识别广泛的文化起源,但在更细致的理解上存在困难。
引用
@article{arxiv.2502.13766,
title = {GIMMICK -- Globally Inclusive Multimodal Multitask Cultural Knowledge Benchmarking},
author = {Florian Schneider and Carolin Holtermann and Chris Biemann and Anne Lauscher},
journal= {arXiv preprint arXiv:2502.13766},
year = {2025}
}