中文

MotionAura:使用离散扩散生成高质量且运动一致的视频

计算机视觉与模式识别 2025-03-12 v2

摘要

视频数据的时空复杂性在压缩、生成和图像内填充等任务中 presents 重大挑战。我们提出了四项关键贡献,以解决时空视频处理的挑战。首先,我们引入了 3D 移动倒置向量量化变分自编码器 (3D-MBQ-VAE),将变分自编码器 (Variational Autoencoders, VAEs) 与掩码标记建模相结合,以增强时空视频压缩。该模型通过采用全帧掩码的新颖训练策略,实现了卓越的时序一致性和最先进 (state-of-the-art, SOTA) 的重构质量。其次,我们提出了 MotionAura,一种文本到视频生成框架,利用向量量化扩散模型对潜在空间进行离散化,以捕获复杂的运动动态,生成与文本提示相匹配的时序连贯的视频。此外,我们提出了一种基于谱变形器的去噪网络,该网络在频域中使用傅里叶变换处理视频数据。该方法有效地捕获全局上下文和长程依赖关系,以实现高质量的视频生成和去噪。最后,我们引入了一种下游任务,即草图引导的视频图像内填充。该任务利用低秩适应 (Low-Rank Adaptation, LoRA) 实现参数高效微调。我们的模型在一系列基准测试中实现了 SOTA 水平。我们的工作为时空建模和用户驱动的视频内容操作提供了稳健的框架。我们将在开源方式发布代码、数据集和模型。

关键词

引用

@article{arxiv.2410.07659,
  title  = {MotionAura: Generating High-Quality and Motion Consistent Videos using Discrete Diffusion},
  author = {Onkar Susladkar and Jishu Sen Gupta and Chirag Sehgal and Sparsh Mittal and Rekha Singhal},
  journal= {arXiv preprint arXiv:2410.07659},
  year   = {2025}
}

备注

Accepted in ICLR 2025 (spotlight paper)