Seeing Culture: 面向视觉推理与 grounding 的基准
计算机视觉与模式识别
2025-09-23 v1 人工智能
计算与语言
多媒体
摘要
多模态视觉语言模型 (VLM) 在需要综合理解视觉和文本内容的各种任务中取得了显著进展,尤其是在文化理解任务方面,随着新文化数据集的涌现而取得了突破。然而,这些数据集经常不足以提供文化推理,同时也低估了许多文化的代表性。在本文中,我们引入了 Seeing Culture Benchmark (SCB),其焦点是文化推理,采用一种需要 VLM 在两个阶段对文化丰富的图像进行推理的方法:i) 进行多选式视觉问答 (VQA),选择正确的视觉选项;ii) 分段相关文化文物作为推理证据。第一阶段的视觉选项系统地组织为三种类型:来自同一国家的选项、来自不同国家的选项或混合组。值得注意的是,所有选项都来自同一类型中的单个类别。只有在正确选择视觉选项后,才会进行第二阶段。SCB 基准包含 1,065 张图片,涵盖来自七个东南亚国家的 138 个文化文物,跨越五个类别,这些样本文化常被忽视,伴随 3,178 个问题,其中 1,093 个由人类标注员精心挑选。我们评估了各种 VLM,揭示了跨模态文化推理的复杂性,并突显了在文化细微场景中视觉推理与空间 grounding 之间的差异。SCB 作为识别这些不足、指导该领域未来发展的关键基准。https://github.com/buraksatar/SeeingCulture
关键词
引用
@article{arxiv.2509.16517,
title = {Seeing Culture: A Benchmark for Visual Reasoning and Grounding},
author = {Burak Satar and Zhixin Ma and Patrick A. Irawan and Wilfried A. Mulyawan and Jing Jiang and Ee-Peng Lim and Chong-Wah Ngo},
journal= {arXiv preprint arXiv:2509.16517},
year = {2025}
}
备注
Accepted to EMNLP 2025 Main Conference, https://seeingculture-benchmark.github.io/