Lumina-Video:基于多尺度 Next-DiT 的高效灵活视频生成
计算机视觉与模式识别
2025-02-13 v2
摘要
近期的进展已将扩散变换器(DiTs)确立为生成模型中的主导框架。基于此成功,Lumina-Next 在 photorealistic 图像生成方面取得卓越性能。然而,其在视频生成方面的潜力仍 largely 未被开发,面临着建模视频数据所固有的时空复杂度的挑战。为此,我们引入 Lumina-Video,一个利用 Next-DiT 优势并为视频合成引入量身定制解决方案的框架。Lumina-Video 包含一种多尺度 Next-DiT 架构,联合学习多种 patchification 以提升效率和灵活性。通过将动作得分作为显式条件,Lumina-Video 还能够直接控制生成视频的运动程度。结合逐渐提高的分辨率和帧率的渐进训练方案,以及混合自然与合成数据的多来源训练方案,Lumina-Video 在高训练和推理效率下实现了卓越的审美质量和运动平滑度。我们另外提出Lumina-V2A,一个基于 Next-DiT 的视频转音频模型,用于为生成视频创建同步音频。代码已发布于 https://www.github.com/Alpha-VLLM/Lumina-Video。
引用
@article{arxiv.2502.06782,
title = {Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT},
author = {Dongyang Liu and Shicheng Li and Yutong Liu and Zhen Li and Kai Wang and Xinyue Li and Qi Qin and Yufei Liu and Yi Xin and Zhongyu Li and Bin Fu and Chenyang Si and Yuewen Cao and Conghui He and Ziwei Liu and Yu Qiao and Qibin Hou and Hongsheng Li and Peng Gao},
journal= {arXiv preprint arXiv:2502.06782},
year = {2025}
}