MiniGPT4-Video:利用交错视觉-文本标记推进视频理解的多模态LLM
计算机视觉与模式识别
2024-04-05 v1
摘要
本文介绍了 MiniGPT4-Video,一个专门为视频理解设计的多模态大型语言模型(LLM)。该模型能够处理时间视觉和文本数据,使其善于理解视频的复杂性。基于 MiniGPT-v2 的成功——该模型在将单张图像的视觉特征转换到 LLM 空间方面表现出色,并在各种图像-文本基准上取得了令人印象深刻的结果——本文将模型的能力扩展到处理帧序列,使其能够理解视频。MiniGPT4-video 不仅考虑视觉内容,还结合了文本对话,使模型能够有效回答同时涉及视觉和文本组件的查询。所提出的模型优于现有的最先进方法,在 MSVD、MSRVTT、TGIF 和 TVQA 基准上分别取得了 4.22%、1.13%、20.82% 和 13.1% 的提升。我们的模型和代码已在此处公开提供:https://vision-cair.github.io/MiniGPT4-video/
引用
@article{arxiv.2404.03413,
title = {MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens},
author = {Kirolos Ataallah and Xiaoqian Shen and Eslam Abdelrahman and Essam Sleiman and Deyao Zhu and Jian Ding and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2404.03413},
year = {2024}
}
备注
6 pages,8 figures