中文

看见符号,忽略文化:探究视觉语言模型在火焰图像及文化意义推理上的表现

计算机视觉与模式识别 2026-01-15 v2 人工智能 计算与语言

摘要

视觉语言模型(VLM)常以文化专业能力出现,但依赖浅层模式匹配而非真正的文化理解。我们引入诊断框架,通过分类与解释分析探究VLM在火焰主题文化图像上的推理能力。测试多个模型于西方节日、非西方传统及紧急场景,揭示系统性偏见:模型正确识别显著西方节日,但在代表性不足的文化活动上表现不佳,常给出模糊标签或危险地将紧急情况误判为庆典。这些失败暴露了符号捷径的风险,凸显需超越准确率指标的文化评估需求,以确保可解释且公平的多模态系统。

关键词

引用

@article{arxiv.2509.23311,
  title  = {Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning},
  author = {Haorui Yu and Yang Zhao and Yijia Chu and Qiufeng Yi},
  journal= {arXiv preprint arXiv:2509.23311},
  year   = {2026}
}

备注

8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025