中文

MMViR:一种面向长视频理解的多模态多粒度表征

计算机视觉与模式识别 2026-01-12 v1 计算与语言

摘要

长视频时长从几分钟到几小时不等,因其复杂事件、多样场景和长程依赖,对当前多模态大语言模型(MLLMs)构成重大挑战。直接编码此类视频计算成本过高,而简单的视频到文本转换往往产生冗余或碎片化的内容。为解决这些局限,我们引入了MMViR,一种用于长视频理解的新型多模态、多粒度结构化表征。MMViR识别关键转折点以分割视频,并构建一个将全局叙事与细粒度视觉细节相结合的三级描述。该设计支持高效的基于查询的检索,并能很好地泛化到各种场景。在包括问答、摘要和检索在内的三项任务上的广泛评估表明,MMViR优于先前最强的方法,在小时级长视频理解上实现了19.67%的提升,同时将处理延迟降低至原来的45.4%。

关键词

引用

@article{arxiv.2601.05495,
  title  = {MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding},
  author = {Zizhong Li and Haopeng Zhang and Jiawei Zhang},
  journal= {arXiv preprint arXiv:2601.05495},
  year   = {2026}
}

备注

13 pages, 11 figures