中文

Videoprompter:一种用于零样本视频理解的基础模型集成框架

计算机视觉与模式识别 2023-10-25 v1

摘要

视觉-语言模型(VLMs)通过计算视觉特征与基于文本的类标签表示之间的相似度分数来对查询视频进行分类。近来,大语言模型(LLMs)已被用于通过增强类名称的描述性来丰富基于文本的类标签。然而,这些改进仅限于基于文本的分类器,而未考虑查询视觉特征。本文中,我们提出了一种将预训练判别式VLMs与预训练生成式视频到文本及文本到文本模型相结合的框架。我们对标准零样本设定引入了两项关键改进。首先,我们提出语言引导的视觉特征增强,并采用视频到文本模型将查询视频转换为其描述形式。所得描述包含查询视频的重要视觉线索,如存在哪些对象及其时空交互。这些描述性线索为VLMs提供额外的语义知识以提升其零样本性能。其次,我们提出面向LLMs的视频特定提示,以生成更有意义的描述来丰富类标签表示。具体而言,我们引入提示技术为类名称创建类别树形层次结构,为额外视觉线索提供更高层次的动作上下文。我们在三种不同零样本设定下展示了我们方法在视频理解中的有效性:1)视频动作识别,2)视频到文本与文本到视频检索,以及3)时间敏感视频任务。在多个基准及各类VLMs上的一致提升证明了我们所提框架的有效性。我们的代码将公开可用。

关键词

引用

@article{arxiv.2310.15324,
  title  = {Videoprompter: an ensemble of foundational models for zero-shot video understanding},
  author = {Adeel Yousaf and Muzammal Naseer and Salman Khan and Fahad Shahbaz Khan and Mubarak Shah},
  journal= {arXiv preprint arXiv:2310.15324},
  year   = {2023}
}