基于强化学习的数据感知视频标记压缩以提高视频理解效率
计算机视觉与模式识别
2026-03-03 v2 人工智能
摘要
视频大语言模型在视频理解任务中展现出显著能力。然而,视频标记的冗余性在推理过程中引入了显著的计算开销,限制了其实际部署。许多压缩算法被提出以优先保留注意力得分最高的特征,以最小化注意力计算中的扰动。然而,注意力得分与正确答案实际贡献之间的相关性尚不明确。为此,我们提出一种新型 \textbf{C}ontribution-\textbf{a}ware token \textbf{Co}mpression algorithm for \textbf{VID}eo understanding (\textbf{CaCoVID}),其显式优化基于标记对正确预测贡献的标记选择策略。首先,我们引入一种基于强化学习的框架,用于优化策略网络,以选择对正确预测贡献最大的视频标记组合。这种范式将焦点从被动的标记保留转向主动发现最优压缩标记组合的探索。其次,我们提出一种具有在线组合空间抽样的组合策略优化算法,这大大减少了视频标记组合的探索空间,从而加快了策略优化的收敛速度。在多样化的视频理解基准测试上进行的广泛实验表明,CaCoVID的有效性。代码已公开于 https://github.com/LivingFutureLab/CaCoVID。
引用
@article{arxiv.2602.01649,
title = {Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning},
author = {Yinchao Ma and Qiang Zhou and Zhibin Wang and Xianing Chen and Hanqing Yang and Jun Song and Bo Zheng},
journal= {arXiv preprint arXiv:2602.01649},
year = {2026}
}
备注
This paper is accepted by AAAI2026