MicroCinema:一种用于文本到视频生成的分治方法
计算机视觉与模式识别
2024-01-01 v2
摘要
我们提出 MicroCinema,一个简洁而高效的高质量、连贯文本到视频生成框架。与现有直接将文本提示与视频对齐的方法不同,MicroCinema 引入了一种分治(Divide-and-Conquer)策略,将文本到视频分为两个阶段:文本到图像生成以及图像与文本到视频生成。该策略具有两大显著优势:a) 使我们能充分利用近期文本到图像模型(如 Stable Diffusion、Midjourney 和 DALLE)的进展,生成照片级真实且高度精细的图像;b) 借助生成的图像,模型可减少在细粒度外观细节上的关注,优先高效学习运动动态。为有效实现该策略,我们引入两个核心设计。首先,我们提出外观注入网络(Appearance Injection Network),增强对给定图像外观的保留。其次,我们引入外观噪声先验(Appearance Noise Prior),一种旨在保持预训练 2D 扩散模型能力的新机制。这些设计使 MicroCinema 能在给定文本提示引导下生成具有精确运动的高质量视频。大量实验证明了该框架的优越性。具体而言,MicroCinema 在 UCF-101 上取得 342.86 的 SOTA 零样本 FVD,在 MSR-VTT 上取得 377.40。视频样本见 https://wangyanhui666.github.io/MicroCinema.github.io/。
引用
@article{arxiv.2311.18829,
title = {MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation},
author = {Yanhui Wang and Jianmin Bao and Wenming Weng and Ruoyu Feng and Dacheng Yin and Tao Yang and Jingxu Zhang and Qi Dai Zhiyuan Zhao and Chunyu Wang and Kai Qiu and Yuhui Yuan and Chuanxin Tang and Xiaoyan Sun and Chong Luo and Baining Guo},
journal= {arXiv preprint arXiv:2311.18829},
year = {2024}
}
备注
Project page: https://wangyanhui666.github.io/MicroCinema.github.io/