中文

MM-VID:利用 GPT-4V(ision) 推进视频理解

计算机视觉与模式识别 2023-10-31 v1

摘要

我们提出 MM-VID,一个集成系统,它利用 GPT-4V 的能力,结合视觉、音频与语音方面的专用工具,以促进先进的视频理解。MM-VID 旨在应对长视频及复杂任务带来的挑战,例如在长达数小时的内容中进行推理以及把握跨多集的故事线。MM-VID 使用基于 GPT-4V 的视频到脚本生成,将多模态元素转写为长文本脚本。所生成的脚本详述人物动作、行为、表情与对话,为大语言模型 (LLMs) 实现视频理解铺平道路。这实现了包括音频描述、人物识别与多模态高层理解在内的先进能力。实验结果证明了 MM-VID 在处理不同视频长度的各种视频类型时的有效性。此外,我们展示了其在交互式环境(如视频游戏与图形用户界面)中应用时的潜力。

关键词

引用

@article{arxiv.2310.19773,
  title  = {MM-VID: Advancing Video Understanding with GPT-4V(ision)},
  author = {Kevin Lin and Faisal Ahmed and Linjie Li and Chung-Ching Lin and Ehsan Azarnasab and Zhengyuan Yang and Jianfeng Wang and Lin Liang and Zicheng Liu and Yumao Lu and Ce Liu and Lijuan Wang},
  journal= {arXiv preprint arXiv:2310.19773},
  year   = {2023}
}

备注

Project page at https://multimodal-vid.github.io/