中文

面向社会认知视觉语言模型:通过多模态故事生成评估文化能力

计算与语言 2025-08-26 v1 计算机与社会

摘要

随着视觉语言模型(VLM)在多样化文化语境中的广泛部署,确保其文化能力对于负责任的 AI 系统至关重要。虽然先前工作评估了文本模型和 VLM 对象识别任务中的文化意识,但尚无研究系统评估 VLMs 在包含文本提示和视觉输入的文化身份线索的情况下,如何适应生成任务的输出。在本文中,我们提出了首个全面评估 VLM 文化能力的框架,通过多模态故事生成,对 5 个当代 VLMs 进行评估。我们的分析显示,VLMs 在文化适应方面具有显著的能力,涵盖姓名、家庭术语和地理标记等丰富的文化特定词汇。然而,我们发现文化能力在不同架构之间差异很大,一些模型表现出相反的文化对齐,自动评估指标显示出架构偏差,与人类评估相矛盾。跨模态评估显示,文化特定输出确实可以通过视觉-语义相似性被检测到(28.7% within-nationality 对比 0.2% cross-nationality recall),但视觉-文化理解仍有限。总之,我们确立了多模态 AI 文化能力的潜力与挑战。我们公开发布了代码和数据:https://github.com/ArkaMukherjee0/mmCultural

关键词

引用

@article{arxiv.2508.16762,
  title  = {Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation},
  author = {Arka Mukherjee and Shreya Ghosh},
  journal= {arXiv preprint arXiv:2508.16762},
  year   = {2025}
}

备注

Accepted at ASI @ ICCV 2025