中文

Factorized-Dreamer: 用有限且低质量数据训练高质量视频生成器

计算机视觉与模式识别 2024-08-20 v1 人工智能

摘要

文本到视频(T2V)生成因其广泛应用于视频生成、编辑、增强和翻译而受到显著关注。然而,高质量(HQ)视频合成极具挑战性,因为真实世界中存在多样且复杂的运动。大多数现有工作通过收集大规模高质量视频来解决这一问题,但这些视频对社区而言难以获取。在本工作中,我们表明公开可用的有限且低质量(LQ)数据足以训练一个高质量视频生成器,无需重新标注或微调。我们将整个 T2V 生成过程分解为两个步骤:基于高度描述性标注生成图像,以及基于生成的图像和简洁的运动细节标注合成视频。具体而言,我们提出了 Factorized-Dreamer,一个用于 T2V 生成的因子化时空框架,包含若干关键设计,包括一个用于组合文本和图像嵌入的适配器、一个用于捕获像素级图像信息的像素感知交叉注意力模块、一个用于更好地理解运动描述的 T5 文本编码器,以及一个用于监督光流的 PredictNet。我们进一步提出了一种噪声调度,在确保视频生成的质量和稳定性方面发挥关键作用。我们的模型降低了对详细标注和高质量视频的需求,可以直接基于有限的低质量数据集(如 WebVid-10M)进行训练,这些数据集包含噪声大且简短的标注,从而大大降低了收集大规模高质量视频-文本对的开销。在各种 T2V 和图像到视频生成任务上的广泛实验证明了我们提出的 Factorized-Dreamer 的有效性。我们的源代码可在 https://github.com/yangxy/Factorized-Dreamer/ 获取。

关键词

引用

@article{arxiv.2408.10119,
  title  = {Factorized-Dreamer: Training A High-Quality Video Generator with Limited and Low-Quality Data},
  author = {Tao Yang and Yangming Shi and Yunwen Huang and Feng Chen and Yin Zheng and Lei Zhang},
  journal= {arXiv preprint arXiv:2408.10119},
  year   = {2024}
}