中文

图像网格可抵视频:使用单一 VLM 的零样本视频问答

计算机视觉与模式识别 2024-03-28 v1 人工智能 计算与语言 机器学习

摘要

受近期大语言模型(LLMs)复杂推理能力的启发,人们设计了多种桥接视频模态的策略。一种突出的策略涉及视频语言模型(VideoLMs),该模型利用视频数据训练一个可学习的接口,将先进的视觉编码器与 LLMs 连接起来。最近,一种替代策略出现,在多个阶段利用现成的基础模型(如 VideoLMs 和 LLMs)进行模态桥接。在本研究中,我们引入了一种简单而新颖的策略,仅使用单一的视觉语言模型(VLM)。我们的出发点是一个简单的洞察:视频由一系列交织了时间信息的图像(即帧)组成。视频理解的本质在于熟练管理时间维度以及每帧的空间细节。首先,我们通过将多帧排列成网格布局,将视频转换为单张合成图像。生成的单张图像被称为图像网格。这种格式在保持单张图像外观的同时,在网格结构内有效保留了时间信息。因此,图像网格方法允许直接应用单一的高性能 VLM,而无需任何视频数据训练。我们在十个零样本视频问答基准(包括五个开放式和五个多选基准)上进行了广泛的实验分析,结果表明所提出的图像网格视觉语言模型(IG-VLM)在十个基准中的九个上超越了现有方法。

关键词

引用

@article{arxiv.2403.18406,
  title  = {An Image Grid Can Be Worth a Video: Zero-shot Video Question Answering Using a VLM},
  author = {Wonkyun Kim and Changin Choi and Wonseok Lee and Wonjong Rhee},
  journal= {arXiv preprint arXiv:2403.18406},
  year   = {2024}
}

备注

Our code is available at https://github.com/imagegridworth/IG-VLM