One-Forcing:面向稳定单步自回归视频生成的探索
计算机视觉与模式识别
2026-05-25 v1 人工智能
摘要
近期进展显著提升了自回归范式下实时交互式视频生成的性能。然而,大多数现有的few-step自回归视频生成方法通常从对应的many-step教师模型蒸馏而来,默认采用4步采样配置,部署时仍存在较大延迟,且在进一步减少采样步骤后(尤其是单步设置)会出现严重的质量下降。基于轨迹风格的一致性蒸馏方法常产生动态较弱的视频,而基于DMD的方法(如Self-Forcing)倾向于生成模糊的帧。为此,我们提出了One-Forcing,一种简单而有效的方法,通过在DMD目标中引入辅助GAN损失,以实现高质量且高效的单步视频生成。在VBench上的实验表明,One-Forcing获得83.76的总体得分,在单步因果视频生成方法中取得最新SOTA性能,并与强大的many-step方法保持竞争力。我们进一步展示,仅需三分之一的训练成本即可实现稳定的单步帧级自回归生成,该设置在先前方法中难以成功实现。
引用
@article{arxiv.2605.23458,
title = {One-Forcing: Towards Stable One-Step Autoregressive Video Generation},
author = {Jiaqi Feng and Justin Cui and Yuanhao Ban and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2605.23458},
year = {2026}
}
备注
Work in Progress. Project Page: https://aurora-edu.github.io/one-forcing/, Code: https://github.com/Aurora-edu/One-Forcing