STARFlow-V:基于正规化流的端到端视频生成模型
计算机视觉与模式识别
2025-11-27 v2 机器学习
摘要
正规化流(NFs)是连续数据上的端到端似然生成模型,近期因在图像生成方面的积极进展而重新受到关注。然而,在视频生成领域,由于时空复杂度和计算成本的显著提升,最先进的系统几乎完全依赖基于扩散的模型。在本工作中,我们重新审视了这一设计空间,通过提出 STARFlow-V,一种基于正规化流的视频生成器,展现了诸多显著优势,如端到端学习、稳健的因果预测和原生似然估计。基于最近提出的 STARFlow,STARFlow-V 在时空潜在空间中运行,采用全局-局部体系结构,该体系结构将因果依赖限制在全局潜在空间中,同时保留帧内丰富的局部互动。这一做法简化了标准自回归扩散模型生成过程中随时间累积的误差。此外,我们提出了 flow-score 匹配,该方法为模型提供了一个轻量级因果去噪器,以自回归方式提高视频生成一致性。为提高采样效率,STARFlow-V 采用视频感知的 Jacobi 迭代方案,将内部更新重新表述为可并行的迭代,而不破坏因果性。由于其可逆结构,同一模型本机支持文本到视频、图像到视频以及视频到视频生成任务。经验上,STARFlow-V 在视觉保真度和时间一致性方面表现出强劲的表现,同时相对于基于扩散的基准实现了实际的采样吞吐量。这些结果据我们所知是首次表明 NFs 能够实现高质量自回归视频生成,确立了其作为构建世界模型的有前景的研究方向。代码和生成样本均已在 https://github.com/apple/ml-starflow 上提供。
引用
@article{arxiv.2511.20462,
title = {STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows},
author = {Jiatao Gu and Ying Shen and Tianrong Chen and Laurent Dinh and Yuyang Wang and Miguel Angel Bautista and David Berthelot and Josh Susskind and Shuangfei Zhai},
journal= {arXiv preprint arXiv:2511.20462},
year = {2025}
}
备注
21 pages, 9 figures. Code and samples are available at https://github.com/apple/ml-starflow