中文

MiniGPT4-Video:利用交错视觉-文本标记推进视频理解的多模态LLM

计算机视觉与模式识别 2024-04-05 v1

摘要

本文介绍了 MiniGPT4-Video,一个专门为视频理解设计的多模态大型语言模型(LLM)。该模型能够处理时间视觉和文本数据,使其善于理解视频的复杂性。基于 MiniGPT-v2 的成功——该模型在将单张图像的视觉特征转换到 LLM 空间方面表现出色,并在各种图像-文本基准上取得了令人印象深刻的结果——本文将模型的能力扩展到处理帧序列,使其能够理解视频。MiniGPT4-video 不仅考虑视觉内容,还结合了文本对话,使模型能够有效回答同时涉及视觉和文本组件的查询。所提出的模型优于现有的最先进方法,在 MSVD、MSRVTT、TGIF 和 TVQA 基准上分别取得了 4.22%、1.13%、20.82% 和 13.1% 的提升。我们的模型和代码已在此处公开提供:https://vision-cair.github.io/MiniGPT4-video/

关键词

引用

@article{arxiv.2404.03413,
  title  = {MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens},
  author = {Kirolos Ataallah and Xiaoqian Shen and Eslam Abdelrahman and Essam Sleiman and Deyao Zhu and Jian Ding and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2404.03413},
  year   = {2024}
}

备注

6 pages,8 figures