AdaReTaKe:面向视频-语言理解的自适应冗余降减以感知更长情境
计算机视觉与模式识别
2025-06-10 v2 计算与语言
多媒体
摘要
多模态大语言模型(MLLMs)已彻底革新了视频理解能力,但在处理长视频时仍受限于上下文长度。最近的一些方法通过统一利用视觉冗余进行视频压缩,取得了令人鼓舞的效果。然而,我们的定量分析表明,冗余在时间维度和模型层次上存在显著差异,因而需要更灵活的压缩策略。我们提出 AdaReTaKe,一种具备理论保证的训练-free 方法,通过在时间维度和层次之间灵活分配压缩比例来灵活降低视觉冗余。将其集成到最先进的 MLLMs 中,AdaReTaKe 可将处理能力从 256 帧提升至 2048 帧,同时保留关键信息。在 VideoMME、MLVU、LongVideoBench 和 LVBench 数据集上的实验表明,AdaReTaKe 分别对 7B 和 72B 参数规模的模型优于现有方法 2.3% 和 2.8%,在最长的 LVBench 数据集上提升更为显著,分别达到 5.9% 和 6.0%。我们的代码已公开于 https://github.com/SCZwangxiao/video-FlexReduc.git。
引用
@article{arxiv.2503.12559,
title = {AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding},
author = {Xiao Wang and Qingyi Si and Jianlong Wu and Shiyu Zhu and Li Cao and Liqiang Nie},
journal= {arXiv preprint arXiv:2503.12559},
year = {2025}
}