FlashVideo:为高效高分辨率视频生成而流动的保真度与细节
计算机视觉与模式识别
2026-02-02 v4
摘要
DiT 模型凭借其在模型容量和数据规模上的可扩展性,在文本到视频生成中取得了巨大成功。然而,与文本提示高度一致的内容和运动保真度通常需要庞大的模型参数和大量的函数评估次数(NFEs)。逼真且视觉上吸引人的细节通常体现在高分辨率输出中,这进一步放大了计算需求——尤其是对于单阶段 DiT 模型。为了解决这些挑战,我们提出了一个新颖的两阶段框架 FlashVideo,该框架在阶段之间策略性地分配模型容量和 NFE,以平衡生成保真度和质量。在第一阶段,通过利用大参数和足够 NFE 的低分辨率生成过程来优先保证提示保真度,从而提高计算效率。第二阶段通过流匹配在低分辨率和高分辨率之间实现近乎直线的 ODE 轨迹,以最小的 NFE 有效生成精细细节并修复伪影。为了在推理过程中确保两个独立训练阶段之间的无缝连接,我们在第二阶段训练期间精心设计了退化策略。定量和可视化结果表明,FlashVideo 以卓越的计算效率实现了最先进的高分辨率视频生成。此外,两阶段设计使用户能够在提交全分辨率生成之前预览初始输出并相应调整提示,从而显著降低计算成本和等待时间,并增强商业可行性。
引用
@article{arxiv.2502.05179,
title = {FlashVideo: Flowing Fidelity to Detail for Efficient High-Resolution Video Generation},
author = {Shilong Zhang and Wenbo Li and Shoufa Chen and Chongjian GE and Peize Sun and Yifu Zhang and Yi Jiang and Zehuan Yuan and Bingyue Peng and Ping Luo},
journal= {arXiv preprint arXiv:2502.05179},
year = {2026}
}
备注
Model and Weight: https://github.com/FoundationVision/FlashVideo