面向社会认知视觉语言模型:通过多模态故事生成评估文化能力
计算与语言
2025-08-26 v1 计算机与社会
摘要
随着视觉语言模型(VLM)在多样化文化语境中的广泛部署,确保其文化能力对于负责任的 AI 系统至关重要。虽然先前工作评估了文本模型和 VLM 对象识别任务中的文化意识,但尚无研究系统评估 VLMs 在包含文本提示和视觉输入的文化身份线索的情况下,如何适应生成任务的输出。在本文中,我们提出了首个全面评估 VLM 文化能力的框架,通过多模态故事生成,对 5 个当代 VLMs 进行评估。我们的分析显示,VLMs 在文化适应方面具有显著的能力,涵盖姓名、家庭术语和地理标记等丰富的文化特定词汇。然而,我们发现文化能力在不同架构之间差异很大,一些模型表现出相反的文化对齐,自动评估指标显示出架构偏差,与人类评估相矛盾。跨模态评估显示,文化特定输出确实可以通过视觉-语义相似性被检测到(28.7% within-nationality 对比 0.2% cross-nationality recall),但视觉-文化理解仍有限。总之,我们确立了多模态 AI 文化能力的潜力与挑战。我们公开发布了代码和数据:https://github.com/ArkaMukherjee0/mmCultural
引用
@article{arxiv.2508.16762,
title = {Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation},
author = {Arka Mukherjee and Shreya Ghosh},
journal= {arXiv preprint arXiv:2508.16762},
year = {2025}
}
备注
Accepted at ASI @ ICCV 2025