中文

探索多模态大语言模型视频理解中显式时间建模的作用

计算机视觉与模式识别 2025-01-29 v1 计算与语言

摘要

将多模态大语言模型(MLLM)应用于视频理解,面临需跨帧建模时间关系的重大挑战。现有方法采用要么仅依赖 LLM 解码器的隐式时间建模,要么引入辅助时间编码器的显式时间建模。为探究这两种范式之间的争议,我们提出了可堆叠时间编码器(STE)。STE 实现了可调节的时间感受野和 token 压缩比例的灵活显式时间建模。使用 STE,我们系统比较了隐式与显式时间建模在整体性能、token 压缩效果及时间专用理解等维度上的差异。我们还探讨了 STE 的设计考量及其作为插件模块和图像模态中的更广泛影响。我们的发现强调了显式时间建模的关键作用,为推动视频 MLLM 的发展提供了可操作性的见解。

关键词

引用

@article{arxiv.2501.16786,
  title  = {Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding},
  author = {Yun Li and Zhe Liu and Yajing Kong and Guangrui Li and Jiyuan Zhang and Chao Bian and Feng Liu and Lina Yao and Zhenbang Sun},
  journal= {arXiv preprint arXiv:2501.16786},
  year   = {2025}
}