LayerFlow:面向分层视频生成的统一模型
计算机视觉与模式识别
2025-06-05 v1
摘要
我们提出 LayerFlow,一种面向分层视频生成的统一解决方案。给定分层提示词,LayerFlow 可生成透明前景、干净背景及混合场景的视频。它还支持多种变体,如分解混合视频或根据给定前景生成背景(反之亦然)。我们基于文本到视频扩散变换器,对不同图层的视频组织为子片段,并利用图层嵌入来区分每个片段及对应的分层提示词。如此一来,我们能在一个统一框架内无缝支持上述各种变体。鉴于缺乏高质量的分层训练视频,我们设计了多阶段训练策略以适配标注高质量分层信息的静态图像。具体而言,我们首先使用低质量视频数据进行训练。随后,我们调优运动 LoRA 以适配静态帧。最后,在包含高质量分层图像和复制粘贴视频数据的混合图像数据上进行内容 LoRA 训练。在推理阶段,我们移除运动 LoRA,从而生成具有所需图层的平滑视频。
引用
@article{arxiv.2506.04228,
title = {LayerFlow: A Unified Model for Layer-aware Video Generation},
author = {Sihui Ji and Hao Luo and Xi Chen and Yuanpeng Tu and Yiyang Wang and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2506.04228},
year = {2025}
}
备注
Project Page: https://sihuiji.github.io/LayerFlow-Page/