中文

LayerT2V:统一的多层视频生成框架

计算机视觉与模式识别 2026-02-27 v2 人工智能 机器学习 多媒体

摘要

文本到视频生成取得了快速进展,但现有方法通常仅输出最终的合成视频,缺乏可编辑的分层表示,限制了其在专业工作流程中的应用。我们提出 LayerT2V,一个统一的多层视频生成框架,能够在单次推理过程中产生多个语义一致的输出:完整视频、独立的背景层,以及多个前景 RGB 层及其对应的 Alpha 遮罩。我们的关键洞察是,近期的视频生成主干网络在时间和空间上的高压缩率,使我们能够将多个层表示序列化沿时间维度,并在共享的生成轨迹上联合建模。这将跨层一致性转化为内在目标,从而提高语义对齐和时间一致性。为缓解层次歧义和条件泄漏,我们增强了共享 DiT 主干网络,引入 LayerAdaLN 和层级感知的跨注意力调制。LayerT2V 在三个阶段进行训练:Alpha 遮罩 VAE 适配、联合多层学习和多前景扩展。我们还引入了 VidLayer,这是第一个大规模的多层视频生成数据集。广泛的实验表明,LayerT2V 在视觉保真度、时间一致性和跨层一致性方面显著优于先前方法。

关键词

引用

@article{arxiv.2508.04228,
  title  = {LayerT2V: A Unified Multi-Layer Video Generation Framework},
  author = {Guangzhao Li and Kangrui Cen and Baixuan Zhao and Yi Xin and Siqi Luo and Guangtao Zhai and Lei Zhang and Xiaohong Liu},
  journal= {arXiv preprint arXiv:2508.04228},
  year   = {2026}
}

备注

Project Page is https://layert2v.github.io/