Video-XL-2:通过任务感知 KV 稀疏化实现超长视频理解
计算机视觉与模式识别
2025-06-25 v1 人工智能
摘要
多模态大语言模型(MLLM) models 近年来在视频理解方面取得了显著进展。然而,由于高昂的内存和计算成本,处理长视频输入仍是一个主要挑战,这使得当前模型在长视频理解中难以实现卓越性能和高效能。为此,我们提出 Video-XL-2,一种 novel MLLM,基于任务感知 KV 稀疏化为长视频理解提供卓越的性价比。该框架包含两个关键步骤:基于块的预填充和双层 key-value 解码。基于块的预填充将视觉 token 序列划分为多个块,在每个块内部应用完整注意力,在块之间应用稀疏注意力。这显著降低了计算和内存开销。解码期间,双层 key-value 解码根据每个块与任务的相关性选择性地重新加载稠密或稀疏 key-value。这一方法进一步提高了内存效率,并增强了模型捕获细粒度信息的能力。Video-XL-2 在各种长视频理解基准测试上实现了领先的性能,超越了现有开源轻量级模型。它还显示出卓越的效率,能够在单个NVIDIA A100(80GB) GPU 上处理超过10,000帧,并在几秒钟内处理成千上万帧。
引用
@article{arxiv.2506.19225,
title = {Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification},
author = {Minghao Qin and Xiangrui Liu and Zhengyang Liang and Yan Shu and Huaying Yuan and Juenjie Zhou and Shitao Xiao and Bo Zhao and Zheng Liu},
journal= {arXiv preprint arXiv:2506.19225},
year = {2025}
}
备注
12 pages, 5 Figure, 3 Table