中文

GIFT:面向高效视频理解的全局不可替代帧定位

计算机视觉与模式识别 2026-03-27 v1

摘要

视频大语言模型(VLMs)在视频理解方面取得了显著进展,但处理稠密帧的计算成本显著限制了其实际应用。现有方法通过选择关键帧来缓解此问题,但其贪心决策过程以及相关性和多样性评估的解耦,常常陷入局部最优,导致错误选择无关的噪声帧。为此,我们提出 GIFT:Global Irreplaceability Frame Targeting,一种新型无训练框架,通过评估帧的内在不可替代性来选择帧。具体而言,我们首先引入 Directed Diversity 以量化帧在相关性条件下的唯一性,从而形成统一的不可替代性评分。随后,Budget-Aware Refinement 策略采用自适应迭代过程,首先确保挑选最高不可替代性的核心帧集合,然后随着预算扩大,转向为这些选择构建关键时间线索。广泛的实验表明,GIFT 在 LLaVA-Video-7B 上对长视频基准实现最高可达 12.5% 的平均提升。

关键词

引用

@article{arxiv.2603.25072,
  title  = {GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding},
  author = {Junpeng Ma and Sashuai Zhou and Guanghao Li and Xin Gao and Yue Cao and Hengyu Zeng and Yuxiang Yan and Zhibin Wang and Jun Song and Bo Zheng and Shanghang Zhang and Jian Pu},
  journal= {arXiv preprint arXiv:2603.25072},
  year   = {2026}
}

备注

11 pages, 3 figures