中文

VideoTree:面向长视频大语言模型推理的自适应树形视频表示

计算机视觉与模式识别 2025-03-17 v3 人工智能 计算与语言

摘要

长视频理解因视频数据的高度冗余和大量与查询无关的信息而变得复杂。为了应对这些挑战,我们提出了VideoTree,这是一个无需训练的框架,为长视频上的大语言模型推理构建了查询自适应且层次化的视频表示。首先,VideoTree通过迭代过程从输入视频中提取与查询相关的信息,逐步根据关键帧与查询的相关性优化关键帧选择。此外,VideoTree利用了长视频数据固有的层次结构(现有基于LLM的方法往往忽略这一点)。具体来说,我们将多粒度信息融入树形表示中,使VideoTree能够以从粗到细的方式从长视频中提取与查询相关的细节。这使得模型能够有效处理各种不同细节层次的视频查询。最后,VideoTree聚合树结构中层次化的查询相关信息,并将其输入LLM推理模型以回答查询。我们的实验表明,我们的方法提高了推理准确性和效率。具体来说,VideoTree在EgoSchema和NExT-QA上以更少的推理时间优于现有的无训练方法,在测试集上分别达到61.1%和75.6%的准确率,无需额外的视频特定训练。此外,在Video-MME的长片段(平均44分钟)上,VideoTree的性能优于GPT-4V和许多其他经过大量视频数据训练的MLLM。

关键词

引用

@article{arxiv.2405.19209,
  title  = {VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos},
  author = {Ziyang Wang and Shoubin Yu and Elias Stengel-Eskin and Jaehong Yoon and Feng Cheng and Gedas Bertasius and Mohit Bansal},
  journal= {arXiv preprint arXiv:2405.19209},
  year   = {2025}
}

备注

CVPR 2025; First three authors contributed equally; Project page: https://videotree2024.github.io/