看见符号,忽略文化:探究视觉语言模型在火焰图像及文化意义推理上的表现
计算机视觉与模式识别
2026-01-15 v2 人工智能
计算与语言
摘要
视觉语言模型(VLM)常以文化专业能力出现,但依赖浅层模式匹配而非真正的文化理解。我们引入诊断框架,通过分类与解释分析探究VLM在火焰主题文化图像上的推理能力。测试多个模型于西方节日、非西方传统及紧急场景,揭示系统性偏见:模型正确识别显著西方节日,但在代表性不足的文化活动上表现不佳,常给出模糊标签或危险地将紧急情况误判为庆典。这些失败暴露了符号捷径的风险,凸显需超越准确率指标的文化评估需求,以确保可解释且公平的多模态系统。
引用
@article{arxiv.2509.23311,
title = {Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning},
author = {Haorui Yu and Yang Zhao and Yijia Chu and Qiufeng Yi},
journal= {arXiv preprint arXiv:2509.23311},
year = {2026}
}
备注
8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025