HORNet:基于视觉语言模型的视频问答任务导向帧选择
计算机视觉与模式识别
2026-03-20 v1
摘要
视频问答(VQA)依赖于视觉语言模型(VLM)选择从输入视频中挑选哪些帧,但大多数系统依赖均匀或启发式抽样,无法针对下游问答质量进行优化。我们提出 HORNet,一种轻量级帧选择策略,通过 Group Relative Policy Optimization(GRPO)进行训练,以学习哪些帧冻结的 VLM 需要来正确回答问题。HORNet 的参数不足 1M,即可将输入帧数最大减少 99%,将 VLM 处理时间最大减少 93%,同时在短格式基准测试上提升答案质量(MSVD-QA 上 F1 提升 1.7%),并在时间推理任务上取得优异性能(NExT-QA 上均匀抽样基准提升 7.3 分)。我们将此形式化为 Select Any Frames(SAF)任务,解耦视觉输入策源与 VLM 推理,表明 GRPO 训练的选择在分布外方面优于监督学习和 PPO 方法。HORNet 的策略还可在不重新训练的情况下跨 VLM 答案生成器迁移,带来额外的 8.5% 相对提升。我们在涵盖 341,877 对 QA 配对和 114.2 小时视频的六个基准测试上进行评估,结果表明优化 VLM 看到的内容是一种实用且互补的替代方案,可在提高效率的同时提升性能。代码可在 https://github.com/ostadabbas/HORNet 获取。
引用
@article{arxiv.2603.18850,
title = {HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models},
author = {Xiangyu Bai and Bishoy Galoaa and Sarah Ostadabbas},
journal= {arXiv preprint arXiv:2603.18850},
year = {2026}
}