中文

一个视频不值一千个字

计算机视觉与模式识别 2025-10-28 v1

摘要

随着我们对日常世界提出问题的视觉语言模型(VLM)的依赖日益增加,越来越多的研究致力于提高视频问答(VQA)数据集的难度,以及评估这些数据集的模型上下文长度。将大型语言模型作为 backbone 的做法导致了关于潜在文本优势的担忧,以及模态之间相互作用的探索仍不充分。我们如何衡量是否正行进于正确方向,考虑到多模态模型所引入的复杂性?我们提出了一种联合方法,用于计算基于Shapley值的方法的特征归因和模态得分,其中特征和模态可以任意定义。使用这些指标,我们对比了 66 种不同上下文长度的 VLM 模型在 44 个代表性数据集上的表现,关注多选形式的 VQA。特别地,我们将视频帧和整个文本元素视为等级结构中的等特征, 将多选 VQA 任务视为视频、问题和答案三个模态之间的相互作用。我们的结果显示对文本的依赖性,表明多选 VQA 任务简化为模型忽略干扰项的能力。代码可在 https://github.com/sjpollard/a-video-is-not-worth-a-thousand-words 查阅。

关键词

引用

@article{arxiv.2510.23253,
  title  = {A Video Is Not Worth a Thousand Words},
  author = {Sam Pollard and Michael Wray},
  journal= {arXiv preprint arXiv:2510.23253},
  year   = {2025}
}