Turbo2K:迈向超高效且高质量的 2K 视频合成
计算机视觉与模式识别
2025-04-22 v1
摘要
随着消费者对超清晰视觉效果的期望不断提高,对 2K 视频合成的需求日益增长。虽然扩散Transformer(DiT)在高质量视频生成方面已展现出显著能力,但将其扩展至 2K 分辨率在计算上仍然不可行,因为内存和处理成本呈二次增长。在本工作中,我们提出 Turbo2K,一个高效且实用的框架,用于生成细节丰富的 2K 视频,同时显著提升训练和推理效率。首先,Turbo2K 在高度压缩的潜在空间中运行,降低了计算复杂度和内存占用,使高分辨率视频合成成为可能。然而,VAE 的高压缩比和有限的模型规模对生成质量构成了制约。为缓解这一问题,我们引入了一种知识蒸馏策略,使较小的学生模型能够继承更大、更强大的教师模型的生成能力。我们的分析表明,尽管潜在空间和架构存在差异,DiT 在其内部表征中展现出结构相似性,从而促进了有效的知识迁移。其次,我们设计了一个分层两阶段合成框架,首先生成低分辨率下的多层次特征,再指导高分辨率视频生成。该方法确保了结构一致性和细粒度细节细化,同时消除了冗余的编码-解码开销,进一步提升了计算效率。Turbo2K 实现了最先进的效率,以显著降低的计算成本生成 5 秒、24fps、2K 视频。与现有方法相比,Turbo2K 的推理速度提升了最多 20 倍,使高分辨率视频生成更具可扩展性和实用性。
引用
@article{arxiv.2504.14470,
title = {Turbo2K: Towards Ultra-Efficient and High-Quality 2K Video Synthesis},
author = {Jingjing Ren and Wenbo Li and Zhongdao Wang and Haoze Sun and Bangzhen Liu and Haoyu Chen and Jiaqi Xu and Aoxue Li and Shifeng Zhang and Bin Shao and Yong Guo and Lei Zhu},
journal= {arXiv preprint arXiv:2504.14470},
year = {2025}
}
备注
Webpage at https://jingjingrenabc.github.io/turbo2k/