中文

通过场景局化帧分组提升长视频问答能力

计算机视觉与模式识别 2025-08-06 v1 人工智能

摘要

当前的多模态大语言模型(MLLMs)在长视频理解方面表现不佳,主要由于资源限制导致无法处理所有视频帧及其相关信息。高效提取相关信息成为一项具有挑战性的任务。现有框架和评估任务聚焦于从大量无关帧中识别特定含有核心物体的帧,这与实际应用场景的需求不符。为此,我们提出了视频问答任务下的一种新情境——SceneQA,强调基于场景的细节感知与推理能力。我们开发了 LVSQA 数据集以支持 SceneQA 任务,该数据集基于精心选取的 LVBench 视频构建,包含全新的问答对集合,以促进对 MLLMs 在长视频场景感知能力的更公平评估。灵感来源于人类认知,我们引入了一种新方法,称为 SLFG。SLFG 的核心思想是将 individual frames 组合成语义连贯的场景帧。通过利用场景局化方法和动态帧重组机制,SLFG 显著增强了现有 MLLMs 在长视频中的理解能力。SLFG 无需修改原始模型架构,具备极佳的即插即用性能。实验结果表明,该方法在几个长视频基准测试中表现卓越。代码和数据集将发布于 http://www.slfg.pkuzwh.cn。

关键词

引用

@article{arxiv.2508.03009,
  title  = {Enhancing Long Video Question Answering with Scene-Localized Frame Grouping},
  author = {Xuyi Yang and Wenhao Zhang and Hongbo Jin and Lin Liu and Hongbo Xu and Yongwei Nie and Fei Yu and Fei Ma},
  journal= {arXiv preprint arXiv:2508.03009},
  year   = {2025}
}