中文

基于图式与叙事情节记忆的长视频理解:GCAgent

计算机视觉与模式识别 2025-11-18 v1 人工智能

摘要

长视频理解是多模态大语言模型(MLLM)面临的重大挑战,主要由于内在的 token 限制以及捕捉长期时间依赖性的复杂性。现有方法往往无法捕获对深入视频推理所必需的全局上下文和复杂事件关系。为此,我们提出了 GCAgent,这是一个创新的全局上下文感知智能体框架,实现全面的数据视频理解。我们的核心创新是图式与叙事情节记忆(Schematic and Narrative Episodic Memory)。该记忆将事件及其因果和时间关系结构化建模,形成简洁有组织的上下文,从而从根本上解决长期依赖问题。our GCAgent 在感知-行动-反思(Perception-Action-Reflection)多阶段循环中运作,利用记忆管理器检索相关情节上下文,以实现稳健、情境感知的推理。广泛的实验表明,GCAgent 显著提升了长视频理解能力,在 Video-MME Long 数据集上相较于强大的 MLLM 基线实现了最高可达 23.5% 的准确率提升。此外,我们的框架在可比的 7B 规模 MLLM 中实现了最好的表现,在 Video-MME Long 数据集上达到 73.4% 的准确率,在 Video-MME 基准的总体平均值(71.9%)中取得最高排名,验证了我们基于智能体的推理范式和结构化记忆对于类认知式长视频理解的有效性。

关键词

引用

@article{arxiv.2511.12027,
  title  = {GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory},
  author = {Jeong Hun Yeo and Sangyun Chung and Sungjune Park and Dae Hoe Kim and Jinyoung Moon and Yong Man Ro},
  journal= {arXiv preprint arXiv:2511.12027},
  year   = {2025}
}