视觉语言模型的文化能力评估
计算机视觉与模式识别
2025-08-15 v2 计算与语言
摘要
现代视觉语言模型(VLM)在文化能力评估和基准测试中经常失败。鉴于构建于 VLM 之上的应用具有多样性,人们对于理解这些模型如何编码文化细微差异重新产生了兴趣。虽然该问题的个别方面已被研究,但我们仍然缺乏一个全面的框架,以系统地识别和标注 VLM 图像中存在的微妙文化维度。这篇立场论文认为,视觉文化研究(文化研究、符号学和视觉研究)的基础方法论对于图像的文化分析是必不可少的。在此综述的基础上,我们提出了一套包含五个框架的集合,分别对应不同的文化维度,在分析 VLM 的文化能力时必须加以考虑,以实现更完整的分析。
引用
@article{arxiv.2505.22793,
title = {Evaluation of Cultural Competence of Vision-Language Models},
author = {Srishti Yadav and Lauren Tilton and Maria Antoniak and Taylor Arnold and Jiaang Li and Siddhesh Milind Pawar and Antonia Karamolegkou and Stella Frank and Zhaochong An and Negar Rostamzadeh and Daniel Hershcovich and Serge Belongie and Ekaterina Shutova},
journal= {arXiv preprint arXiv:2505.22793},
year = {2025}
}