中文

REDUCIO!使用极度压缩运动潜变量在 16 秒内生成 1K 视频

计算机视觉与模式识别 2025-08-13 v3

摘要

商业视频生成模型已展现出逼真、高保真的结果,但仍受限于访问受限。一个关键障碍是昂贵的训练和推理成本。本文我们认为视频比图像包含更多冗余信息,能够用极少的运动潜变量进行编码。为此,我们设计了一个基于图像条件的 VAE,将视频投影到极度压缩的潜空间,并基于内容图像进行解码。这种魔法般的 Reducio 魔法使我们能够将潜变量减少 64 倍,同时不牺牲质量。基于 Reducio-VAE,我们可以高效训练用于高分辨率视频生成的扩散模型。具体而言,我们采用两阶段生成范式,首先通过文本到图像生成得到条件图像,然后通过我们提出的 Reducio-DiT 进行文本-图像到视频生成。大量实验表明,我们的模型在评估指标上表现优异。更重要的是,我们的方法显著提升了视频扩散模型的训练和推理效率。Reducio-DiT 总计仅用 3.2K 个 A100 GPU 小时即可训练,在单个 A100 GPU 上即可在 15.5 秒内生成一段 16 帧 1024×\times1024 视频。代码已发布于 https://github.com/microsoft/Reducio-VAE。

关键词

引用

@article{arxiv.2411.13552,
  title  = {REDUCIO! Generating 1K Video within 16 Seconds using Extremely Compressed Motion Latents},
  author = {Rui Tian and Qi Dai and Jianmin Bao and Kai Qiu and Yifan Yang and Chong Luo and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2411.13552},
  year   = {2025}
}

备注

Accepted to ICCV2025. Code available at https://github.com/microsoft/Reducio-VAE