中文

构建心灵宫殿:用于有效长视频分析的环境导向语义图结构

计算机视觉与模式识别 2026-03-05 v2

摘要

大型视觉语言模型用于长视频理解面临需要在有限上下文窗口内分析时间分散但空间集中关键时刻的挑战。本文引入了受“心灵宫殿”启发的 VideoMindPalace 框架,将关键视频时刻组织成拓扑结构化的语义图。VideoMindPalace 通过 (i) 手部-物体跟踪与交互、(ii) 表示特定区域反复活动区域的聚类活动区、(iii) 环境布局映射,将关键信息组织起来,使 LLM 能够通过自然语言提供关于时空和 3D 背景的有根见解。此外,我们提出了 Video MindPalace 基准(VMB),用于评估包括空间局部化、时间推理和布局感知顺序理解在内的人类式推理。在 VMB 以及既定视频问答数据集(包括 EgoSchema、NExT-QA、IntentQA 和 Active Memories 基准)上评估显示,VideoMindPalace 在时空连贯性和人类对齐推理方面均取得显著提升,推动了 VLMs 的长视频分析能力。

关键词

引用

@article{arxiv.2501.04336,
  title  = {Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs},
  author = {Zeyi Huang and Yuyang Ji and Xiaofang Wang and Nikhil Mehta and Tong Xiao and Donghyun Lee and Sigmund Vanvalkenburgh and Shengxin Zha and Bolin Lai and Yiqiu Ren and Licheng Yu and Ning Zhang and Yong Jae Lee and Miao Liu},
  journal= {arXiv preprint arXiv:2501.04336},
  year   = {2026}
}