动态视频生成:跨时空的视频生成塑形
计算机视觉与模式识别
2026-05-21 v1
摘要
扩散模型在视频生成方面取得了令人印象的性能,但其迭代去噪过程因处理每个时间步的大量 token 而计算成本高昂。最近,渐进分辨率抽样作为一种有前景的加速方法,通过在早期阶段降低潜空间分辨率来实现。然而,将这一想法扩展到视频生成仍具有挑战,因为额外的时间维度引入了不同视频之间时空需求的多样性,仅压缩单一维度往往导致加速有限或质量下降。因此,我们提出了 DVG 框架,即 Dynamic Video Generation,联合在时空之间分配计算量,自动选择内容感知的加速策略,无需手动调参或重新训练。DVG 在不同模型和任务上实现接近无损的加速,HunyuanVideo 和 HunyuanVideo-1.5 上加速比达到约 7 倍,结合蒸馏后可达 18 倍,展示了其作为当今大规模高效视频生成系统关键组件的潜力。我们的代码在补充材料中,并将在 Github 上发布。
引用
@article{arxiv.2605.21042,
title = {Dynamic Video Generation: Shaping Video Generation Across Time and Space},
author = {Shikang Zheng and Jingkai Huang and Jiacheng Liu and Guantao Chen and Lixuan and Yuqi Lin and Peiliang Cai and Linfeng Zhang},
journal= {arXiv preprint arXiv:2605.21042},
year = {2026}
}