FrameOracle:学习在视频中该看什么以及该看多少
计算机视觉与模式识别
2026-02-02 v2
摘要
视觉语言模型 (VLM) 推进视频理解,但在紧张的计算预算下运行,导致性能依赖于选择小且高质量的帧子集。现有的帧抽样策略,如均匀抽样或固定预算选择,无法适应内容密度或任务复杂性的变化。为此,我们提出 FrameOracle,一个轻量级、即插即用模块,预测 (1) 给定查询的最相关帧以及 (2) 需要的帧数。FrameOracle 通过从弱代理信号(如跨模态相似性)到强监督信号(FrameOracle-41K)的课程训练,后者是第一个具有验证关键帧注释的数据集,指定每个问题的最小充分帧。广泛实验显示,FrameOracle 将 16 帧输入减少到平均 10.4 帧而不损失准确性。当从 64 帧候选开始时,平均减少到 13.9 帧,同时提高 1.5% 的准确性,实现了可扩展视频理解的 SOTA 效率-准确性权衡。
引用
@article{arxiv.2510.03584,
title = {FrameOracle: Learning What to See and How Much to See in Videos},
author = {Chaoyu Li and Tianzhi Li and Fei Tao and Zhenyu Zhao and Ziqian Wu and Maozheng Zhao and Juntong Song and Cheng Niu and Pooyan Fazli},
journal= {arXiv preprint arXiv:2510.03584},
year = {2026}
}