中文

BIMBA: 用于长视频问答的选择性扫描压缩

计算机视觉与模式识别 2025-03-14 v2

摘要

长视频中的视频问答(VQA)面临从大量冗余帧中提取相关信息并建模长程依赖关系的关键挑战。自注意力机制为序列建模提供了通用解决方案,但在应用于长视频中大量时空标记时计算代价极高。大多数先前方法依赖压缩策略来降低计算代价,例如通过稀疏帧采样减少输入长度,或通过时空池化压缩传递给大语言模型(LLM)的输出序列。然而,这些朴素方法过度表示冗余信息,往往遗漏显著事件或快速出现的时空模式。在本工作中,我们提出了 BIMBA,一种用于处理长视频的高效状态空间模型。我们的模型利用选择性扫描算法,学习从高维视频中有效选择关键信息,并将其转换为供 LLM 高效处理的缩减标记序列。大量实验表明,BIMBA 在多个长视频 VQA 基准测试上达到了最先进的准确率,包括 PerceptionTest、NExT-QA、EgoSchema、VNBench、LongVideoBench 和 Video-MME。代码和模型已在 https://sites.google.com/view/bimba-mllm 公开发布。

关键词

引用

@article{arxiv.2503.09590,
  title  = {BIMBA: Selective-Scan Compression for Long-Range Video Question Answering},
  author = {Md Mohaiminul Islam and Tushar Nagarajan and Huiyu Wang and Gedas Bertasius and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:2503.09590},
  year   = {2025}
}

备注

Accepted by CVPR 2025