Look Every Frame All at Once:基于多轴梯度检查点技术的 Video-Ma$^2$mba 高效长视频理解
计算机视觉与模式识别
2024-12-02 v1 人工智能
机器学习
摘要
随着视频数据规模和复杂度的不断增长,高效处理长视频序列提出了显著挑战,因为基于 Transformer 的大型多模态模型 (LMM) 现有的注意力机制导致内存和计算需求呈二次增长。为此,我们提出 Video-Mamba,这是一种新型架构,集成了状态空间模型 (SSM) 于 Mamba-2 框架中,以取代注意力机制。这使得 LMM 在时间和内存要求上可线性扩展,能够处理持续数小时的视频内容。此外,我们引入多轴梯度检查点 (MA-GC) 方法,战略性地管理内存,通过仅保留关键激活值来实现。我们的做法显著降低了相较于标准梯度检查点的内存占用。实证分析表明,Video-Mamba 能够在单个 GPU 上处理相当于数百万标记或超过两小时连续序列(以 1 FPS 计)的视频。通过保持对时间动态的细致捕获,我们的模型在长视频理解任务中提升了响应的准确性和相关性,相较于现有框架展现出显著优势。
引用
@article{arxiv.2411.19460,
title = {Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing},
author = {Hosu Lee and Junho Kim and Hyunjun Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2411.19460},
year = {2024}
}
备注
Project page: https://ivy-lvlm.github.io/Video-MA2MBA/