迈向单步因果视频生成:基于对抗自蒸馏的方法
计算机视觉与模式识别
2026-03-19 v2
摘要
最近的混合视频生成模型结合了自回归时间动态和基于扩散的空间去噪,但其顺序迭代的特性导致了误差累积和较长的推理时间。在这项工作中,我们提出了一个基于蒸馏的框架,用于高效的因果视频生成,该框架能够在极有限的去噪步骤下实现高质量合成。我们的方法建立在分布匹配蒸馏(DMD)框架之上,并提出了一种新颖的对抗自蒸馏(ASD)策略,该策略在分布层面上将学生模型的n步去噪过程的输出与其(n+1)步版本对齐。这种设计通过弥合小的学生内部差距提供了更平滑的监督,并通过结合教师知识与局部一致的学生行为提供了更具信息性的指导,从而在极少数步骤(例如1-2步)场景中显著提高了训练稳定性和生成质量。此外,我们提出了一种首帧增强(FFE)策略,该策略为初始帧分配更多的去噪步骤以减轻误差传播,同时对后续帧应用更大的跳跃步长。在VBench上的大量实验表明,我们的方法在单步和两步视频生成方面均超越了最先进的方法。值得注意的是,我们的框架产生了一个单一的蒸馏模型,可以灵活地支持多种推理步长设置,消除了重复再蒸馏的需要,实现了高效、高质量的视频合成。
引用
@article{arxiv.2511.01419,
title = {Towards One-step Causal Video Generation via Adversarial Self-Distillation},
author = {Yongqi Yang and Huayang Huang and Xu Peng and Xiaobin Hu and Donghao Luo and Jiangning Zhang and Chengjie Wang and Yu Wu},
journal= {arXiv preprint arXiv:2511.01419},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026