中文

面向长视频理解的任务感知 KV 压缩

计算机视觉与模式识别 2025-06-27 v1 人工智能

摘要

长视频理解 (LVU) 仍是现有多模态大语言模型 (MLLM) 面临的严峻挑战,主要由于计算成本的高昂。近期方法尝试通过 KV 压缩缓解此问题,但常常在压缩比率较高时出现显著信息损失。本文引入了 Video-X^2L,以灵活方式保留每项 LVU 任务所需的关键视频信息。Video-X^2L 包含两项关键操作:第一项称为双层 KV 压缩。在 MLLM 的填充阶段,Video-X^2L 生成两种压缩后的 KV:低压缩 KV (L-KV) 用于捕获细粒度视频细节,高压缩 KV (H-KV) 用于提供紧凑的视频表征。第二项称为选择性 KV 重加载。在 MLLM 的解码阶段,Video-X^2L 根据重要性选择性地为最关键的视频块重新加载 L-KV,而对其他不太重要的块使用 H-KV。这使得 MLLM 能充分利用任务特定信息,同时保持整体紧凑性。Video-X^2L 简洁且高效:它无需额外训练,直接兼容现有的可压缩 KV 的 MLLM。我们在多套热门 LVU 基准测试中评估了 Video-X^2L,包括 VideoMME、MLVU、LongVideoBench 和 VNBench。实验结果表明,Video-X^2L 在显著降低计算成本的同时,凭借巨大的优势超越了现有的 KV 压缩方法。

关键词

引用

@article{arxiv.2506.21184,
  title  = {Task-Aware KV Compression For Cost-Effective Long Video Understanding},
  author = {Minghao Qin and Yan Shu and Peitian Zhang and Kun Lun and Huaying Yuan and Juenjie Zhou and Shitao Xiao and Bo Zhao and Zheng Liu},
  journal= {arXiv preprint arXiv:2506.21184},
  year   = {2025}
}

备注

14 pages, 3 figures, 6 tables