中文

MagicDistillation:面向大规模少步合成的弱到强视频蒸馏

计算机视觉与模式识别 2025-04-01 v2

摘要

最近,开源视频扩散模型(VDMs),如 WanX、Magic141 和 HunyuanVideo,已被扩展至超过 100 亿参数。这些大规模 VDMs 在多个维度上较较小规模的 VDMs 展现出显著改进,包括增强的视觉质量和更自然的运动动态。然而,这些模型面临两大限制:(1)高推理开销:大规模 VDMs 在单个 H100 GPU 上合成一个 28 步视频大约需要 10 分钟。(2)人像视频合成受限:WanX-I2V 和 HunyuanVideo-I2V 等模型在人像视频中常产生不自然的面部表情和动作。为应对这些挑战,我们提出 MagicDistillation,一个旨在降低推理开销同时确保 VDMs 在人像视频合成中泛化能力的新框架。具体而言,我们主要使用足够高质量的说话视频来微调专用于人像视频合成的 Magic141。然后,我们采用 LoRA 在名为分布匹配蒸馏(DMD)的步数蒸馏框架内,有效且高效地微调伪 DiT。随后,我们应用弱到强(W2S)分布匹配,并最小化伪数据分布与真值分布之间的差异,从而提高合成视频的视觉保真度和运动动态。在人像视频合成上的实验结果证明了 MagicDistillation 的有效性,我们的方法在 FID/FVD 指标和 VBench 上均超越了 Euler、LCM 和 DMD 基线。此外,仅需 4 步的 MagicDistillation 在可视化和 VBench 上也优于 WanX-I2V (14B) 和 HunyuanVideo-I2V (13B)。我们的项目页面是 https://magicdistillation.github.io/MagicDistillation/。

关键词

引用

@article{arxiv.2503.13319,
  title  = {MagicDistillation: Weak-to-Strong Video Distillation for Large-Scale Few-Step Synthesis},
  author = {Shitong Shao and Hongwei Yi and Hanzhong Guo and Tian Ye and Daquan Zhou and Michael Lingelbach and Zhiqiang Xu and Zeke Xie},
  journal= {arXiv preprint arXiv:2503.13319},
  year   = {2025}
}