VideoLLM-MoD: 基于深度混合视觉计算的高效视频语言流处理
计算机视觉与模式识别
2024-08-30 v1
摘要
大型视觉语言模型(如 GPT-4、LLaVA)面临一个众所周知的困境:虽然增加视觉 token 的数量通常会增强视觉理解能力,但也会显著增加内存和计算成本,这在长期、密集的视频帧流处理场景中尤为突出。尽管已有 Q-Former 和 Perceiver Resampler 等可学习方法被开发用于减轻视觉 token 负担,但它们忽略了 LLM 因果建模的上下文(即键值缓存),在处理用户查询时可能导致视觉线索遗漏。本文引入一种新方法,通过让冗余视觉 token“跳过层”而非减少视觉 token 数量来降低视觉计算量。我们的方法 VideoLLM-MoD 受深度混合 LLM 启发,旨在解决长期或流式视频中大量视觉 token 的挑战。具体而言,对于每个 transformer 层,我们学习跳过大部分(例如 80%)视觉 token 的计算,将其直接传递至下一层。该方法显著提升了模型效率,在整个训练过程中实现了约 42% 的时间节省和约 30% 的内存节省。此外,我们的方法减少了上下文中的计算且未减少视觉 token 数量,因此与原始模型相比,性能得以保持甚至有所提升。我们进行了大量实验以证明 VideoLLM-MoD 的有效性,展示了其在多个基准测试上的 SOTA 结果,包括 COIN、Ego4D 和 Ego-Exmo4D 数据集上的叙述、预测和摘要任务。
关键词
引用
@article{arxiv.2408.16730,
title = {VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation},
author = {Shiwei Wu and Joya Chen and Kevin Qinghong Lin and Qimeng Wang and Yan Gao and Qianli Xu and Tong Xu and Yao Hu and Enhong Chen and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2408.16730},
year = {2024}
}