视觉语言模型中的文化失时与时序推理
计算机视觉与模式识别
2026-05-15 v1 人工智能
计算与语言
摘要
视觉-语言模型(VLM)正在应用于文化遗产材料,从数字档案馆到教育平台。本工作识别了这些模型解释历史文物时的根本性问题。我们将这一现象定义为文化失时,即模型使用时代不合适的概念、材料或文化框架来解释历史对象。为量化这一现象,我们引入了面向视觉-语言模型的时序失时基准(TAB-VLM),该基准包含600个问题,涵盖六个类别,旨在评估在前史至现代时期共计1,600件印度文化文物上的时序推理。对十个最先进模型的系统评估揭示了本基准上的显著不足,即使是表现最好的模型(GPT-5.2)也仅达到58.7%的总体准确率。性能差距在不同架构和规模之间持续存在,这表明文化失时是视觉AI系统的重要局限,无论模型大小如何。这些发现凸显了当前VLM能力与准确解释文化遗产材料(特别是非西方视觉文化)之间的差距。我们的基准为与历史文物交互的多模态AI系统增强时序认知提供了基础。该数据集和代码均可在我们的项目页面获取。
引用
@article{arxiv.2605.15071,
title = {On the Cultural Anachronism and Temporal Reasoning in Vision Language Models},
author = {Mukul Ranjan and Prince Jha and Khushboo Kumari and Zhiqiang Shen},
journal= {arXiv preprint arXiv:2605.15071},
year = {2026}
}
备注
Project Page: https://khushboo0012.github.io/tab-vlm-webpage/