视频 LLM 中基于瞬时采样的长篇视频问答
计算机视觉与模式识别
2025-07-02 v1 人工智能
计算与语言
摘要
近期视频大型语言模型(Video LLM)的快速发展显著推动了视频问答(VideoQA)领域的发展。然而,现有方法在处理短视频时表现良好,但在 longer videos 上进行 long-range 推理时常常力不从。为扩展 Video LLM 对 longer video 内容的适用性,常采用帧子采样(按固定间隔选择帧)的方法,但这种方法并非最优,往往导致关键帧丢失或多个相似帧中包含冗余信息。缺失关键帧会损害模型准确回答问题的能力,而冗余帧则使模型聚焦于无关视频片段并增加计算资源消耗。本文我们利用通用文本到视频瞬时检索模型引导帧采样过程,提出一种新颖的“moment sampling”方法,该方法是模型无关的,可使模型根据问题上下文选择最相关的帧。具体而言,我们采用轻量级瞬时检索模型优先进行帧选择。通过聚焦于给定问题最相关的帧,我们的方法提升了 Video LLM 在 long-form VideoQA 任务中的性能。我们在四个 long-form VideoQA 数据集上进行了大量实验,使用四个最先进的 Video LLM 进行评估,证明了所提出方法的有效性。
引用
@article{arxiv.2507.00033,
title = {Moment Sampling in Video LLMs for Long-Form Video QA},
author = {Mustafa Chasmai and Gauri Jagatap and Gouthaman KV and Grant Van Horn and Subhransu Maji and Andrea Fanelli},
journal= {arXiv preprint arXiv:2507.00033},
year = {2025}
}
备注
Workshop on Video Large Language Models (VidLLMs) at CVPR 2025