中文

面向多模态大语言模型的多粒度视频表示 Mavors

机器学习 2025-04-15 v1

摘要

多模态大语言模型(MLLM)中的长上下文视频理解面临一个关键挑战:在保持细粒度时空模式的保留方面,需要在计算效率和信息保留之间进行权衡。现有方法(如稀疏抽样、低分辨率密集抽样和 token 压缩)在时序动态、空间细节或细微互动方面存在显著信息损失,尤其是在复杂运动或分辨率变化的视频中。为此,我们提出一种名为 Mavors 的新框架,引入一种用于整体长视频建模的 多粒度 视频 表示。具体而言,Mavors通过两种核心组件直接将原始视频内容编码为潜在表示:1)基于3D卷积和视觉Transformer的 intra-chunk Vision Encoder(IVE),可保留高分辨率空间特征;2)基于Transformer的 inter-chunk Feature Aggregator(IFA),使用 chunk 级别 rotary position 编码建立时序连贯性。此外,该框架通过将图像视为单帧视频的子图像分解,实现了图像和视频理解的统一。实验表明,Mavors在保持空间保真度和时序连续性方面具有优势,显著优于现有方法在需要细粒度时空推理的任务上表现更佳。

关键词

引用

@article{arxiv.2504.10067,
  title  = {Undermining Federated Learning Accuracy in EdgeIoT via Variational Graph Auto-Encoders},
  author = {Kai Li and Shuyan Hu and Bochun Wu and Sai Zou and Wei Ni and Falko Dressler},
  journal= {arXiv preprint arXiv:2504.10067},
  year   = {2025}
}

备注

7 pages and 6 figures. Accepted in IEEE IWCMC 2025