您的视觉语言模型在长视频采样困境中会迷路吗?
计算机视觉与模式识别
2025-03-31 v2
摘要
大型视觉语言模型(LVLMs)的兴起显著推动了视频理解的进展。然而,由于“采样困境”:低密度采样风险遗漏关键信息,而高密度采样则引入冗余,高效处理长视频仍是一个挑战。为解决此问题,我们提出了LSDBench,即第一个专为评估LVLMs在长视频任务中表现而设计的基准测试,通过构建高必要采样密度(NSD)问题,其中NSD表示准确回答给定问题所需的最小采样密度。LSDBench聚焦于密集、短时长的动作,以严格评估LVLMs所采用的采样策略。为应对高NSD问题所带来的挑战,我们提出了一种新型的基于推理的层次化采样(RHS)框架,该框架结合了问题相关线索的全局定位与局部密集采样,以实现精确推断。此外,我们开发了一个轻量级语义引导帧选择器,以优先选择信息丰富的帧,使RHS能够以显著减少的采样帧数实现相当或更好的性能。我们的方法既解决了高NSD长视频任务的独特挑战,又为评估和改进LVLMs在该领域的表现设定了新的标准。我们的基准测试和评估代码已发布于:https://github.com/dvlab-research/LSDBench
引用
@article{arxiv.2503.12496,
title = {Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?},
author = {Tianyuan Qu and Longxiang Tang and Bohao Peng and Senqiao Yang and Bei Yu and Jiaya Jia},
journal= {arXiv preprint arXiv:2503.12496},
year = {2025}
}