中文

V-DyKnow:面向时序知识的视觉语言模型动态基准

人工智能 2026-03-18 v1

摘要

视觉语言模型(VLMs)在文档数据快照(包括图像和文本)上进行训练,其训练数据和评估基准通常是静态的,隐式地将事实知识视为时不变的。然而,现实世界的事实本质上是时序敏感的,并受到不规则和周期性变化,导致模型预测变得过时。我们提出 V-DyKnow,即面向时序事实知识的视觉动态知识基准,用于评估 VLMs 的时序知识。通过 V-DyKnow,我们基准测试了闭源和开源 VLMs,并分析 a) 模型响应在不同模态和输入扰动下的可靠性(正确性和一致性);b) 知识编辑和多模态 RAG 方法在不同模态上的知识更新效果;c) 过时预测的来源,通过数据和机制分析。我们的结果显示,VLMs 经常输出过时事实,反映出(预)训练阶段使用的过时快照。即使在实体被正确识别的情况下,事实可靠性也从文本 stimuli 下降到视觉 stimuli。此外,现有的对齐方法未能在不同模态上一致更新模型的知识。总而言,这些发现凸显了当前 VLMs 在跨模态获取和更新时序知识方面的根本性限制。我们发布了基准测试、代码和评估数据。

关键词

引用

@article{arxiv.2603.16581,
  title  = {V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models},
  author = {Seyed Mahed Mousavi and Christian Moiola and Massimo Rizzoli and Simone Alghisi and Giuseppe Riccardi},
  journal= {arXiv preprint arXiv:2603.16581},
  year   = {2026}
}