视觉语言模型是困惑的旅游者
计算机视觉与模式识别
2025-12-24 v3 计算与语言
摘要
虽然文化维度是评估视觉语言模型 (VLM) 的关键方面之一,但它们在面对多样化文化输入时保持稳定性的能力仍大体未被测试,尽管这对于支持多元文化社会至关重要。现有的评估往往依赖仅包含单一文化概念的基准,忽略了多个 potentially 不相关文化线索共存的情形。为此,我们引入 ConfusedTourist,一套新的文化对抗鲁棒性套件,用于评估 VLM 对受扰动地理线索的稳定性。我们的实验揭示了一个关键脆弱性,在简单图像堆叠扰动下准确率大幅下降,即使使用其图像生成变体也会进一步恶化。解释性分析进一步表明,这些失败源于模型对引人注意线索的系统性注意力转移,使其偏离原本的关注重点。这些发现突显了一个关键挑战:视觉文化概念的混合会显著损害即便是最先进的 VLM 的性能,凸显了迫切需要更具文化鲁棒性的多模态理解能力的紧迫性。
引用
@article{arxiv.2511.17004,
title = {Vision Language Models are Confused Tourists},
author = {Patrick Amadeus Irawan and Ikhlasul Akmal Hanif and Muhammad Dehan Al Kautsar and Genta Indra Winata and Fajri Koto and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2511.17004},
year = {2025}
}