中文

ABMAMBA:面向高效视频描述的层次化双向扫描对齐 Mamba 多模态大语言模型

计算机视觉与模式识别 2026-04-10 v1

摘要

本研究聚焦于视频描述,致力于构建完全开源的多模态大语言模型 (MLLM)。视觉序列的理解具有挑战性,因为其复杂的时序依赖性和巨大的序列长度。现有基于 Transformer 的方法,其核心注意力机制随序列长度呈二次方增长,计算上往往不可接受。为此,我们提出 Aligned Hierarchical Bidirectional Scan Mamba (ABMamba),一种具有线性计算复杂度的完全开源 MLLM,实现了对视频序列的可扩展处理。ABMamba 将深度状态空间模型扩展为其语言骨干网络,取代昂贵的二次注意力机制,同时采用一种新颖的对齐层次化双向扫描模块,在多个时间分辨率上处理视频。在标准的视频描述基准数据集(如 VATEX 和 MSR-VTT)上,ABMamba 显示出与典型 MLLM 相当的性能,同时实现了约三倍的吞吐量提升。

关键词

引用

@article{arxiv.2604.08050,
  title  = {ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning},
  author = {Daichi Yashima and Shuhei Kurita and Yusuke Oda and Shuntaro Suzuki and Seitaro Otsuki and Komei Sugiura},
  journal= {arXiv preprint arXiv:2604.08050},
  year   = {2026}
}

备注

Accepted to ICPR 2026