BIMBA: 用于长视频问答的选择性扫描压缩
计算机视觉与模式识别
2025-03-14 v2
摘要
长视频中的视频问答(VQA)面临从大量冗余帧中提取相关信息并建模长程依赖关系的关键挑战。自注意力机制为序列建模提供了通用解决方案,但在应用于长视频中大量时空标记时计算代价极高。大多数先前方法依赖压缩策略来降低计算代价,例如通过稀疏帧采样减少输入长度,或通过时空池化压缩传递给大语言模型(LLM)的输出序列。然而,这些朴素方法过度表示冗余信息,往往遗漏显著事件或快速出现的时空模式。在本工作中,我们提出了 BIMBA,一种用于处理长视频的高效状态空间模型。我们的模型利用选择性扫描算法,学习从高维视频中有效选择关键信息,并将其转换为供 LLM 高效处理的缩减标记序列。大量实验表明,BIMBA 在多个长视频 VQA 基准测试上达到了最先进的准确率,包括 PerceptionTest、NExT-QA、EgoSchema、VNBench、LongVideoBench 和 Video-MME。代码和模型已在 https://sites.google.com/view/bimba-mllm 公开发布。
引用
@article{arxiv.2503.09590,
title = {BIMBA: Selective-Scan Compression for Long-Range Video Question Answering},
author = {Md Mohaiminul Islam and Tushar Nagarajan and Huiyu Wang and Gedas Bertasius and Lorenzo Torresani},
journal= {arXiv preprint arXiv:2503.09590},
year = {2025}
}
备注
Accepted by CVPR 2025