中文

TimeViper:一种用于高效长视频理解的混合Mamba-Transformer视觉语言模型

计算机视觉与模式识别 2025-11-27 v2 人工智能 计算与语言

摘要

我们介绍TimeViper,这是一种为解决长视频理解挑战而设计的混合视觉语言模型。处理长视频既需要高效的模型架构,也需要有效处理扩展的时序上下文。为此,TimeViper采用混合Mamba-Transformer骨干网络,将状态空间模型的效率与注意力机制的表达性相结合。通过这种混合设计,我们揭示了从视觉token到文本token的信息聚合现象,即随着LLM深度的增加,信息从视觉token逐层流向文本token,导致严重的视觉token冗余。针对这一观察,我们提出TransV模块,将视觉token传递并压缩为指令token,同时保持多模态理解能力。该设计使TimeViper能够处理超过10,000帧的时长视频。广泛的实验表明,TimeViper在多个基准测试上与最先进的模型相当,同时扩展了帧数。我们进一步分析了Mamba和Transformer层的注意力行为,提供了关于混合模型解释性的新见解。本工作是面向发展、解释和压缩混合Mamba-Transformer架构的初始步骤。

关键词

引用

@article{arxiv.2511.16595,
  title  = {TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding},
  author = {Boshen Xu and Zihan Xiao and Jiaze Li and Jianzhong Ju and Zhenbo Luo and Jian Luan and Qin Jin},
  journal= {arXiv preprint arXiv:2511.16595},
  year   = {2025}
}

备注

Project page: https://xuboshen.github.io/TimeViper; Code: https://github.com/xiaomi-research/timeviper