中文

VidCompress:大语言模型中基于记忆的时序压缩视频理解

计算机视觉与模式识别 2024-10-16 v1 多媒体

摘要

视频多模态大语言模型(Video-LLMs)在视频理解任务中具有巨大的潜力。然而,大多数Video-LLMs将视频视为一组连续的单个帧,导致时空相互作用不足,阻碍细粒度理解,并难以处理更长时间的视频由于视觉标记容量有限。为此,我们提出了VidCompress——一种具有记忆增强时序压缩的Video-LLM。VidCompress采用双重压缩器:记忆增强压缩器捕获视频中的短期和长期时序关系,并利用带记忆缓存机制的多尺度变换器压缩视觉标记;文本感知压缩器则利用Q-Former,通过交叉注意力将时序上下文整合到查询嵌入中,以生成浓缩的视觉标记。在多个VideoQA数据集和全面基准测试上进行实验表明,VidCompress高效地建模了复杂的时空关系,显著优于现有的Video-LLMs。

关键词

引用

@article{arxiv.2410.11417,
  title  = {VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models},
  author = {Xiaohan Lan and Yitian Yuan and Zequn Jie and Lin Ma},
  journal= {arXiv preprint arXiv:2410.11417},
  year   = {2024}
}

备注

9 pages, 4 figures