Moonshot:面向多模态条件可控视频生成与编辑
计算机视觉与模式识别
2024-01-04 v1
摘要
现有的大多数视频扩散模型 (VDMs) 仅限于纯文本条件。因此,它们通常缺乏对生成视频的视觉外观和几何结构的控制。本工作提出了 Moonshot,一种新的视频生成模型,它同时以图像和文本的多模态输入为条件。该模型建立在一个称为多模态视频块 (MVB) 的核心模块之上,该模块由用于表示视频特征的常规时空层和一个解耦的交叉注意力层组成,后者用于处理图像和文本输入以实现外观条件化。此外,我们精心设计了模型架构,使其能够选择性地集成预训练的图像 ControlNet 模块以实现几何视觉条件,与先前的方法相比无需额外的训练开销。实验表明,凭借通用的多模态条件化机制,与现有模型相比,Moonshot 在视觉质量和时序一致性方面均有显著提升。此外,该模型可以轻松地重新用于各种生成应用,例如个性化视频生成、图像动画和视频编辑,揭示了其作为可控视频生成基础架构的潜力。模型将在 https://github.com/salesforce/LAVIS 上公开。
引用
@article{arxiv.2401.01827,
title = {Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions},
author = {David Junhao Zhang and Dongxu Li and Hung Le and Mike Zheng Shou and Caiming Xiong and Doyen Sahoo},
journal= {arXiv preprint arXiv:2401.01827},
year = {2024}
}
备注
project page: https://showlab.github.io/Moonshot/