视频扩散模型的分阶段单步对抗均衡
计算机视觉与模式识别
2025-12-29 v3
摘要
视频扩散生成面临严重的采样效率瓶颈,尤其是针对大规模模型和长上下文。现有视频加速方法源自图像技术,缺乏大规模视频模型的单步骤蒸馏能力以及条件下游任务的通用性。为填补这一差距,我们提出 Video Phased Adversarial Equilibrium (V-PAE),一种使大规模视频模型能够实现高质量单步骤视频生成的蒸馏框架。我们的方法采用两个阶段。(i) 稳定性预热是一种对齐真实视频和生成视频分布的预热过程,可提高后续过程中的单步骤对抗蒸馏稳定性。(ii) 统一对抗均衡是一种灵活的自对抗过程,重复使用生成器参数用于判别器 backbone。它在 Gaussian 噪声空间中实现共演化的对抗均衡。对于条件任务,我们主要保留 video-image 主体一致性,这源于条件帧在图像到视频 (I2V) 生成期间的语义退化和条件帧坍缩。在 VBench-I2V 上进行的全面实验表明,V-PAE 在整体质量评分(包括语义对齐、时间一致性和帧质量)上优于现有加速方法平均提高 5.8%。此外,我们的方法将大规模视频模型(如 Wan2.1-I2V-14B)的扩散延迟缩短 100 倍,同时保持有竞争力的性能。
引用
@article{arxiv.2508.21019,
title = {Phased One-Step Adversarial Equilibrium for Video Diffusion Models},
author = {Jiaxiang Cheng and Bing Ma and Xuhua Ren and Hongyi Henry Jin and Kai Yu and Peng Zhang and Wenyue Li and Yuan Zhou and Tianxiang Zheng and Qinglin Lu},
journal= {arXiv preprint arXiv:2508.21019},
year = {2025}
}
备注
Accepted by AAAI 2026. Project Page: https://v-pae.github.io/