中文

Mavors:面向多模态大语言模型的多粒度视频表示

计算机视觉与模式识别 2025-12-01 v2 人工智能 计算与语言

摘要

多模态大语言模型(MLLM)中的长上下文视频理解面临一个关键挑战:在保持细粒度时空模式的同时实现计算效率。现有方法(如稀疏采样、低分辨率稠密采样和 token 压缩)在时序动态、空间细节或细微互动方面存在显著信息丢失,尤其是在运动复杂或分辨率变化的视频中。为解决此问题,我们提出了 Mavors\mathbf{Mavors},一种一种新颖框架,引入 M\mathbf{M}ulti-granularity v\mathbf{v}ideo r\mathbf{r}epresentation for holistic long-video modeling。具体而言,Mavors 通过两个核心组件直接编码原始视频内容以生成潜在表示:1)Intra-chunk Vision Encoder(IVE),通过 3D 卷积和 Vision Transformer 保留高分辨率空间特征;2)Inter-chunk Feature Aggregator(IFA),使用基于块级旋转位置编码的 transformer-based 依赖建模在块之间建立时序一致性。此外,该框架通过将图像视为单帧视频(通过子图像分解)来统一图像和视频理解。跨越多个基准数据集的实验表明,Mavors 在保持空间保真度和时序连续性方面具有优势,在需要细粒度时空推理的任务中显著优于现有方法。

关键词

引用

@article{arxiv.2504.10068,
  title  = {Mavors: Multi-granularity Video Representation for Multimodal Large Language Model},
  author = {Yang Shi and Jiaheng Liu and Yushuo Guan and Zhenhua Wu and Yuanxing Zhang and Zihao Wang and Weihong Lin and Jingyun Hua and Zekun Wang and Xinlong Chen and Bohan Zeng and Wentao Zhang and Fuzheng Zhang and Wenjing Yang and Di Zhang},
  journal= {arXiv preprint arXiv:2504.10068},
  year   = {2025}
}

备注

22 pages