中文

GPT4Video:面向指令跟随理解与安全感知生成的统一多模态大语言模型

计算机视觉与模式识别 2024-10-29 v2

摘要

尽管多模态大语言模型(MLLM)近期的进展构成了该领域的重大飞跃,这些模型主要局限于输入侧多模态理解领域,缺乏多模态内容生成能力。为填补此空白,我们提出GPT4Video,一个统一的多模型框架,赋予大语言模型(LLM)视频理解与生成的能力。具体而言,我们开发了基于指令跟随的方法并与稳定扩散生成模型相集成,已证明能有效且安全地处理视频生成场景。GPT4Video具有以下优势:1) 它在视频理解与生成场景中均展现出令人印象深刻的能力。例如,GPT4Video在视频问答任务上以11.8%优于Valley,并在文本到视频生成任务上以2.3%超越NExt-GPT。2) 它赋予LLM/MLLM视频生成能力而无需额外训练参数,并可灵活对接多种模型以执行视频生成。3) 它以端到端方式在输出侧与输入侧均维持安全健康的对话。定性与定性实验表明,GPT4Video有潜力成为能有效、安全且类人的视频助手,处理视频理解与生成场景。

关键词

引用

@article{arxiv.2311.16511,
  title  = {GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation},
  author = {Zhanyu Wang and Longyue Wang and Zhen Zhao and Minghao Wu and Chenyang Lyu and Huayang Li and Deng Cai and Luping Zhou and Shuming Shi and Zhaopeng Tu},
  journal= {arXiv preprint arXiv:2311.16511},
  year   = {2024}
}

备注

ACM MM 2024, Oral