中文

VidCtx:基于图像模型的上下文感知视频问答

计算机视觉与模式识别 2025-04-08 v2 人工智能 多媒体

摘要

为解决大型多模态模型在视频问答任务中的计算和内存限制,近期一些方法提取每帧的文本表示(例如通过字幕生成)并将其输入大型语言模型(LLM)进行处理以产生最终响应。然而,这种方式下LLM无法访问视觉信息,并且通常需要处理相邻帧的重复文本描述。为解决这些不足,本文引入了VidCtx,一种新颖的无需训练的VideoQA框架,它整合了两种模态,即输入帧的视觉信息和其他帧的文本描述,从而提供适当的上下文。更具体地说,在所提出的框架中,预训练的大型多模态模型(LMM)被提示以固定间隔提取视频帧的问题感知文本描述(字幕)。这些描述将作为上下文,当同一个LMM被提示回答当前问题时,输入包括a)某个帧,b)问题,c)适当帧的上下文/字幕。为避免冗余信息,我们选择远距离帧的描述作为上下文。最后,使用简单而有效的最大池化机制来聚合帧级决策。该方法使模型能够关注视频的相关片段并扩展到高帧数。实验表明,VidCtx在三个公开视频QA基准(NExT-QA、IntentQA和STAR)上,在依赖开放模型的方法中取得了有竞争力的性能。我们的代码可在https://github.com/IDT-ITI/VidCtx获取。

关键词

引用

@article{arxiv.2412.17415,
  title  = {VidCtx: Context-aware Video Question Answering with Image Models},
  author = {Andreas Goulas and Vasileios Mezaris and Ioannis Patras},
  journal= {arXiv preprint arXiv:2412.17415},
  year   = {2025}
}

备注

Accepted in IEEE ICME 2025. This is the authors' accepted version