通过基于查询的帧选择提高视频问答
计算机视觉与模式识别
2026-01-13 v1 机器学习
摘要
视频问答(VideoQA)模型通过增强对音视频内容的理解和交互,使其在教育、监视、娱乐和内容创建等多个领域更加可访问、可搜索和实用。由于计算需求重大,大多数大型视觉语言模型(VLMs)用于VideoQA依赖于固定数量的帧,通过均匀采样视频。然而,这一过程并未挑选重要帧或捕获视频的上下文。我们提出了一种基于子可互信息(SMI)函数的查询基准帧选择方法。通过取代均匀帧采样,本方法确保所选帧为准确的VideoQA提供互补且关键的视觉信息。我们在覆盖多动作视频任务的MVBench数据集上评估了该方法。该数据集上的VideoQA准确率使用两种VLMs进行评估,即Video-LLaVA和LLaVA-NeXT,两者最初采用均匀帧采样。实验采用均匀和查询基准采样策略进行。使用查询基准帧选择相对于均匀采样可实现最高达到4%的准确率提升。定性分析进一步表明,查询基准选择使用SMI函数始终能选取更符合问题的帧。我们认为,此类查询基准帧选择可以提高广泛依赖仅部分视频帧的任务的准确率。
关键词
引用
@article{arxiv.2601.07459,
title = {Improving Video Question Answering through query-based frame selection},
author = {Himanshu Patil and Geo Jolly and Ramana Raja Buddala and Ganesh Ramakrishnan and Rohit Saluja},
journal= {arXiv preprint arXiv:2601.07459},
year = {2026}
}