BOLT:免训练提升大型视觉语言模型以实现长视频理解
计算机视觉与模式识别
2025-03-28 v1
摘要
大型视频语言模型(VLMs)在各种视频理解任务中展现出了可喜的进展。然而,它们在长视频分析中的有效性受限于有限的上下文窗口。传统方法(如均匀帧采样)通常不可避免地将资源分配给无关内容,从而降低了其在实际场景中的有效性。在本文中,我们通过全面研究帧选择策略,引入了 BOLT,一种无需额外训练即可提升大型 VLMs 的方法。首先,为了在长视频理解中更真实地评估 VLMs,我们提出了一种多源检索评估设置。我们的发现表明,均匀采样在含噪上下文中表现不佳,凸显了选择正确帧的重要性。其次,我们探索了几种基于查询-帧相似性的帧选择策略,并分析了它们在推理时的有效性。结果表明,逆变换采样带来了最显著的性能提升,将 Video-MME 基准上的准确率从 53.8% 提升至 56.1%,将 MLVU 基准上的准确率从 58.9% 提升至 63.4%。我们的代码可在 https://github.com/sming256/BOLT 获取。
引用
@article{arxiv.2503.21483,
title = {BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding},
author = {Shuming Liu and Chen Zhao and Tianqi Xu and Bernard Ghanem},
journal= {arXiv preprint arXiv:2503.21483},
year = {2025}
}
备注
Accepted to CVPR 2025