中文

面向一键视频生成的扩散对抗后训练

计算机视觉与模式识别 2025-10-03 v3 人工智能 机器学习

摘要

扩散模型广泛用于图像和视频生成,但其迭代生成过程缓慢且资源占用大。虽然现有的蒸馾方法在图像领域已展示出一键生成的潜力,但仍存在显著的质量下降。在本工作中,我们提出了一种针对真实数据的扩散对抗后训练(APT),用于一键视频生成。为提高训练稳定性和质量,我们引入了若干改进的模型架构和训练程序,以及近似R1正则化目标。实验表明,我们的对抗后训练模型Seaweed-APT能够在单个前向评估步骤中实时生成2秒、1280x720、24fps的视频。此外,我们的模型能够在单一步骤中生成1024px图像,质量可与最先进的方法相当。

关键词

引用

@article{arxiv.2501.08316,
  title  = {Diffusion Adversarial Post-Training for One-Step Video Generation},
  author = {Shanchuan Lin and Xin Xia and Yuxi Ren and Ceyuan Yang and Xuefeng Xiao and Lu Jiang},
  journal= {arXiv preprint arXiv:2501.08316},
  year   = {2025}
}

备注

ICML 2025