中文

从图像到视频,我们需要什么样的多模态大语言模型?

计算机视觉与模式识别 2025-05-19 v2

摘要

从图像 LLM 到更复杂的视频 LLM,多模态大语言模型(MLLM)通过诸多研究展示了在理解跨模态信息方面的深刻能力。以往的方法通过将视频基础模型与原始 LLM 集成来设计综合性视频 LLM。尽管这种方法有效,但会导致视频 LLM 结构冗长,通常需要大量视频数据进行预训练。关键是忽略了利用现成图像 LLM 基础贡献的潜力。本文引入 RED-VILLM,即资源高效开发管道,通过利用图像 LLM 的先验知识构建稳健的视频 LLM。具体来说,由于视频本质上是沿时间维度的图像组合,我们设计了一种时间适应的插即拔结构,赋予 backbone 图像 LLM 把握时间信息的能力。通过应用该管道,我们实现了首个视频 LLM。广泛的实验表明,通过我们方法开发的视频 LLM 超过传统视频 LLM,所需的指令数据和训练资源更少。我们的方法凸显了在多模态模型方面更具成本效益和可扩展性的潜力。

关键词

引用

@article{arxiv.2404.11865,
  title  = {From Image to Video, what do we need in multimodal LLMs?},
  author = {Suyuan Huang and Haoxin Zhang and Linqing Zhong and Honggu Chen and Yan Gao and Yao Hu and Zengchang Qin},
  journal= {arXiv preprint arXiv:2404.11865},
  year   = {2025}
}