面向一键视频生成的扩散对抗后训练
计算机视觉与模式识别
2025-10-03 v3 人工智能
机器学习
摘要
扩散模型广泛用于图像和视频生成,但其迭代生成过程缓慢且资源占用大。虽然现有的蒸馾方法在图像领域已展示出一键生成的潜力,但仍存在显著的质量下降。在本工作中,我们提出了一种针对真实数据的扩散对抗后训练(APT),用于一键视频生成。为提高训练稳定性和质量,我们引入了若干改进的模型架构和训练程序,以及近似R1正则化目标。实验表明,我们的对抗后训练模型Seaweed-APT能够在单个前向评估步骤中实时生成2秒、1280x720、24fps的视频。此外,我们的模型能够在单一步骤中生成1024px图像,质量可与最先进的方法相当。
引用
@article{arxiv.2501.08316,
title = {Diffusion Adversarial Post-Training for One-Step Video Generation},
author = {Shanchuan Lin and Xin Xia and Yuxi Ren and Ceyuan Yang and Xuefeng Xiao and Lu Jiang},
journal= {arXiv preprint arXiv:2501.08316},
year = {2025}
}
备注
ICML 2025