中文

自回归对抗后训练用于实时交互式视频生成

计算机视觉与模式识别 2025-10-03 v2 人工智能 机器学习

摘要

现有的大规模视频生成模型计算密集,阻碍了其在实时和交互式应用中的采用。在本工作中,我们提出了自回归对抗后训练(Autoregressive Adversarial Post-Training, AAPT),将预训练的潜在视频扩散模型转换为实时交互式视频生成器。我们的模型通过单次神经网络评估(1NFE)自回归地逐帧生成潜在帧。该模型可以实时将结果流式传输给用户,并接收交互式响应作为控制指令以生成下一潜在帧。与现有方法不同,我们的方法探索了对抗训练作为自回归生成的有效范式。这不仅使我们能够设计一种更高效的一步生成架构,同时充分利用 KV 缓存,还使我们能够以学生强迫(student-forcing)方式训练模型,被证明在减少长视频生成过程中的误差累积方面是有效的。我们的实验表明,我们的 8B 模型在单个 H100 上以 736×416 分辨率实现实时 24fps 流式视频生成,或在 8×H100 上以 1280×720 分辨率生成长达一分钟(1440 帧)的视频。访问我们的研究网站:https://seaweed-apt.com/2

关键词

引用

@article{arxiv.2506.09350,
  title  = {Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation},
  author = {Shanchuan Lin and Ceyuan Yang and Hao He and Jianwen Jiang and Yuxi Ren and Xin Xia and Yang Zhao and Xuefeng Xiao and Lu Jiang},
  journal= {arXiv preprint arXiv:2506.09350},
  year   = {2025}
}

备注

NeurIPS 2025