中文

帧数过多,并非全部有用:长视频问答的高效策略

计算机视觉与模式识别 2026-01-27 v6

摘要

跨越长时间间隔的长视频信息高度冗余,并包含多个通常松散相关的不同事件或实体。因此,在执行长视频问答时,生成正确响应所需的所有信息通常可以包含在一小部分帧中。最近的文献利用大型语言模型在长视频问答基准测试中取得了卓越的性能,同时依赖视觉语言模型将视频中的所有视觉内容转换为自然语言。这类视觉语言模型通常独立地为从长视频中均匀采样的大量帧生成字幕,这效率不高,而且大部分可能是冗余的。受这种低效的启发,我们提出了LVNet,一个模块化且无需训练的框架,其特点是新颖的层次化关键帧选择器,能够针对每个问题高效地选择一组最小的信息帧。LVNet的模块化特性使其易于与现有方法集成,以实现更高效的长视频问答。我们在四个基准长视频问答数据集(EgoSchema、NExT-QA、IntentQA、VideoMME)上,在类似配置的模型中取得了最先进的性能。代码可在https://github.com/jongwoopark7978/LVNet找到。

关键词

引用

@article{arxiv.2406.09396,
  title  = {Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA},
  author = {Jongwoo Park and Kanchana Ranasinghe and Kumara Kahatapitiya and Wonjeong Ryu and Donghyun Kim and Michael S. Ryoo},
  journal= {arXiv preprint arXiv:2406.09396},
  year   = {2026}
}