帧中之世界:理解文化混合作为视觉语言模型的新挑战
计算机视觉与模式识别
2025-12-11 v2
摘要
在全球化的世界中,来自不同来源的文化元素频繁出现于单一视觉场景中。我们称这些为文化混合场景,但大型视觉语言模型(LVLMs)如何感知这些场景仍未得到充分探讨。本文将文化混合视为LVLMs的关键挑战,考察当前模型在来自多个地区的文化元素共存时的行为表现。为系统分析这些行为,我们构建了CultureMix数据集,这是一个包含23k个扩散生成、经人工核查的文化混合食物视觉问答(VQA)基准测试,涵盖四个子任务:(1)食物-only,(2)食物+食物,(3)食物+背景,(4)食物+食物+背景。评估10个LVLMs后发现,在混合场景中,这些模型一致未能保留 individual 文化身份。模型表现出强烈的背景依赖,随着文化背景被添加至食物-only基线,准确率下降14%,且它们对相同食物在不同上下文中的预测结果不一致。为缓解这些限制,我们探索了三种鲁棒性策略。我们发现,使用多样化的文化混合数据集进行监督微调可显著提升模型一致性,降低背景敏感性。我们呼吁 increased attention于文化混合场景,这是迈向开发能够在文化多样化真实环境中可靠运行的LVLMs的关键步骤。
引用
@article{arxiv.2511.22787,
title = {World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models},
author = {Eunsu Kim and Junyeong Park and Na Min An and Junseong Kim and Hitesh Laxmichand Patel and Jiho Jin and Julia Kruk and Amit Agarwal and Srikant Panda and Fenal Ashokbhai Ilasariya and Hyunjung Shim and Alice Oh},
journal= {arXiv preprint arXiv:2511.22787},
year = {2025}
}