Magic 1-For-1:一分钟内生成一分钟视频片段
计算机视觉与模式识别
2025-02-18 v3
摘要
在本技术报告中,我们提出了 Magic 1-For-1 (Magic141),一种优化了内存消耗和推理延迟的高效视频生成模型。其核心思想很简单:将文本到视频生成任务分解为两个独立的更简单任务以进行扩散步蒸馏,即文本到图像生成和图像到视频生成。我们验证了在相同的优化算法下,图像到视频任务确实比文本到视频任务更容易收敛。我们还探索了一系列优化技巧,从三个方面降低了训练图像到视频(I2V)模型的计算成本:1)通过使用多模态先验条件注入加速模型收敛;2)通过应用对抗步蒸馏加速推理延迟;3)通过参数稀疏化优化推理内存开销。借助这些技术,我们能够在 3 秒内生成 5 秒的视频片段。通过应用测试时滑动窗口,我们能够在一分钟内生成一分钟长的视频,且视觉质量和运动动态显著提升,平均生成 1 秒视频片段花费不到 1 秒。我们进行了一系列初步探索,以寻找扩散步蒸馏期间计算成本与视频质量之间的最佳折衷,希望这能成为开源探索的良好基础模型。代码和模型权重可在 https://github.com/DA-Group-PKU/Magic-1-For-1 获取。
引用
@article{arxiv.2502.07701,
title = {Magic 1-For-1: Generating One Minute Video Clips within One Minute},
author = {Hongwei Yi and Shitong Shao and Tian Ye and Jiantong Zhao and Qingyu Yin and Michael Lingelbach and Li Yuan and Yonghong Tian and Enze Xie and Daquan Zhou},
journal= {arXiv preprint arXiv:2502.07701},
year = {2025}
}
备注
Serious updates are needed