中文

VULCA-Bench:多文化视觉语言基准用于评估文化理解

计算与语言 2026-02-26 v3 计算机视觉与模式识别

摘要

我们引入VULCA-Bench,一个多文化艺术评论基准,用于评估视觉语言模型(VLMs)的文化理解能力,超越表层视觉感知。现有VLM基准主要衡量L1-L2能力(对象识别、场景描述、事实性问答),而忽略高阶文化解释。VULCA-Bench包含7,410组匹配的图像-评论对,覆盖八大文化传统,支持中文-英文双语。我们采用五层框架(L1-L5,从视觉感知到哲学美学) operationalize 文化理解,定义为225个文化特定维度,并由专家编写双语评论支持。我们的初步结果表明,高阶推理(L3-L5)在挑战性上 consistently 高于视觉和技术分析(L1-L2)。该数据集、评估脚本和标注工具已在CC BY 4.0许可下开源于https://github.com/yha9806/VULCA-Bench。

关键词

引用

@article{arxiv.2601.07986,
  title  = {VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding},
  author = {Haorui Yu and Diji Yang and Hang He and Fengrui Zhang and Qiufeng Yi},
  journal= {arXiv preprint arXiv:2601.07986},
  year   = {2026}
}

备注

8 pages, 4 figures, submitted to ACL 2026 Dataset Track