中文

基于Shot的视频帧采样用于视频理解

计算机视觉与模式识别 2026-03-19 v1

摘要

视频帧采样对于高效的长视频理解至关重要,因为密集输入代价高昂且常常超出上下文限制。然而,当只能保留少量帧时,现有采样方法往往难以在广泛的视频覆盖和简短但关键事件之间取得平衡,这可能导致下游预测不可靠。为此,我们提出 InfoShot,一个面向长视频理解的任务无关、基于Shot的帧采样器。InfoShot 首先将视频划分为语义一致的Shot,然后从每个Shot中选择两个互补的关键帧:一个用于代表主要内容,另一个用于捕捉Shot内部的异常变化。此设计受信息论目标的指导,该目标鼓励所选帧集保留关于Shot结构和稀疏Shot内偏差的高信息。如此一来,在无需重新训练的情况下提高了保留整体视频上下文和短决策关键时刻的机会。为更好地评估此类短暂事件,我们进一步引入 SynFlash,一个具有可控亚秒异常模式和帧级真实值的合成基准,并在现有异常数据集和通用视频理解任务上评估 InfoShot。实验表明,InfoShot 在帧数受限的情况下提高了异常命中率和下游 Video-QA准确率,同时在标准视频理解基准测试中与或优于强大的基线方法。

关键词

引用

@article{arxiv.2603.17374,
  title  = {Shot-Aware Frame Sampling for Video Understanding},
  author = {Mengyu Zhao and Di Fu and Yongyu Xie and Jiaxing Zhang and Zhigang Yuan and Shirin Jalali and Yong Cao},
  journal= {arXiv preprint arXiv:2603.17374},
  year   = {2026}
}