中文

视觉语言模型是否是跨文化心智推理者?

计算与语言 2026-01-08 v2 计算机视觉与模式识别 计算机与社会

摘要

心智理论(ToM)——即对他人的信念和意图进行归因的能力——是社交智能的基本要素,但视觉语言模型(VLM)的评估仍主要以西方为中心。在本工作中,我们引入CulturalToM-VQA,一个包含5095个跨文化语境、仪式和社交规范下的视觉化ToM探针的数据集。通过一个专门的大型多模态语言模型(LLM)构建的专家校准管道,构建了该数据集,涵盖六类ToM任务和四个复杂度水平。我们对10个VLMs(2023-2025年)进行基准测试,观察到显著的性能提升:尽管早期模型在该基准上表现困难,但前沿模型实现了高于93%的准确率。然而,显著的局限性仍然存在:模型在误信念推理方面表现有限(19%-83%准确率),且表现出显著的区域差异(20%-30%差距)。关键地,我们发现SOTA模型表现出社交善意偏见——系统性地偏好语义正面答案选择而非负面答案。消融实验表明,一些前沿模型高度依赖参数化的社交先验,经常默认为安全对齐的预测。此外,尽管链式思考(Chain-of-Thought)提示对旧模型有所帮助,但对新型模型几乎没有收益。总体而言,我们的工作为跨文化社交推理提供了一个测试平台,阐明了尽管架构取得了进步,实现稳健、以视觉为导向的理解仍是开放挑战。

引用

@article{arxiv.2512.17394,
  title  = {Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?},
  author = {Zabir Al Nazi and GM Shahariar and Md. Abrar Hossain and Wei Peng},
  journal= {arXiv preprint arXiv:2512.17394},
  year   = {2026}
}