中文

ValueGround:评估多模态大语言模型中文化条件化视觉价值 grounding 的基准

计算与语言 2026-04-16 v2

摘要

文化价值不仅通过语言表达,也通过视觉场景和日常社会实践表达。然而,现有的文化价值评估几乎全部基于文本,因而难以判断模型在面对可视化选项时是否能够进行文化条件化的判断。我们提出 ValueGround,这是一个用于评估多模态大语言模型(MLLMs)中文化条件化视觉价值 grounding 的基准测试集。基于世界价值调查(World Values Survey, WVS)中的问题,ValueGround 使用 minimally contrastive 图像对来表示对立的选项,同时控制无关变异。给定国家、问题和图像对,模型需在无需访问原始选项文本的情况下,选择最符合该国家价值倾向的图像。我们测试了 6 个 MLLMs 和 13 个国家,结果显示在文本-only 设置下平均准确率为 72.8%,而在选项可视化后下降到 65.8%,但选项图像对齐度仍达 92.8%。更强的模型更稳健,但所有模型都容易出现预测逆转。我们的基准测试为研究跨模态文化条件化价值判断的迁移提供了受控测试环境。

关键词

引用

@article{arxiv.2604.06484,
  title  = {ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs},
  author = {Zhipin Wang and Christoph Leiter and Christian Frey and Mohamed Hesham Ibrahim Abdalla and Josif Grabocka and Steffen Eger},
  journal= {arXiv preprint arXiv:2604.06484},
  year   = {2026}
}

备注

Updated preprint