VIMI:通过多模态指令实现视频生成 grounding
计算机视觉与模式识别
2024-07-10 v1 人工智能
计算与语言
摘要
现有的文本到视频扩散模型仅依赖文本编码器进行预训练。这一局限性源于缺乏大规模多模态提示视频数据集,导致缺乏视觉 grounding,限制了其在多模态集成中的应用和灵活性。为此,我们构建了一个大规模多模态提示数据集,通过检索方法将上下文中的示例与给定文本提示配对,然后采用两阶段训练策略,使同一模型能够处理多样化的视频生成任务。在第一阶段,我们提出了一种用于预训练的多模态条件视频生成框架,建立了面向 grounded 视频生成的基础模型。在第二阶段,我们在三个视频生成任务上进行微调,融合多模态指令。这一过程进一步细化了模型处理多样化输入和任务的能力,确保了多模态信息的无缝集成。经过这两阶段的训练后,VIMI 能够理解多模态信息,生成基于所提供输入的情境丰富且具有个人化特征的视频,如图1所示。与以往的视觉 grounded 视频生成方法相比,VIMI 能够合成一致且在时间上连贯的大范围运动视频,同时保持语义控制。最后,VIMI 还在 UCF101 数据集上实现了最新的文本到视频生成结果。
关键词
引用
@article{arxiv.2407.06304,
title = {VIMI: Grounding Video Generation through Multi-modal Instruction},
author = {Yuwei Fang and Willi Menapace and Aliaksandr Siarohin and Tsai-Shien Chen and Kuan-Chien Wang and Ivan Skorokhodov and Graham Neubig and Sergey Tulyakov},
journal= {arXiv preprint arXiv:2407.06304},
year = {2024}
}