中文

FocusGraph:基于图结构的机械化长视频问答帧选择

计算机视觉与模式识别 2026-03-05 v1

摘要

理解长视频的能力对具身智能体至关重要,因为其有效性取决于其如何能够累积、组织和利用长期感知记忆。最近,多模态大语言模型(MLLM)因其广泛的自然语言理解能力和世界知识运用能力而在解决长视频理解任务方面受到欢迎。然而,随着提供给 MLLM 的帧数增加,其响应质量倾向于下降,推理时间也随之增长。因此,在使用 MLLM 进行长视频理解时,选择用户查询相关的关键帧是一个关键步骤。本文开发 FocusGraph,一个针对以身临其境方式拍摄的长视频问答的关键帧选择框架。它利用轻量可训练的场景标题 LLM 选择器,基于其图基标题选择与查询相关的片段,并采用一种无训练的方法从这些片段中选择关键帧。与现有方法不同,所提议的场景标题 LLM 选择器不依赖于低分辨率帧的原始序列;相反,它 operate于场景的紧凑文本表示之上。我们然后设计一种训练-free 的 Patch-wise 稀疏流保持(PSFR)方法,从所得片段序列中选择关键帧,将其输入 MLLM 以生成最终答案。通过这些组件,FocusGraph 在包括 FindingDory 和 HourVideo 在内的具有挑战性的具身化长视频问答基准测试中实现了最先进的结果,同时显著降低了相对于基线方法的推理时间。

关键词

引用

@article{arxiv.2603.04349,
  title  = {FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering},
  author = {Tatiana Zemskova and Solomon Andryushenko and Ilya Obrubov and Viktoriia Khoruzhaia and Ekaterina Eroshenko and Ekaterina Derevyanka and Dmitry Yudin},
  journal= {arXiv preprint arXiv:2603.04349},
  year   = {2026}
}