中文

Latte:用于视频生成的潜在扩散 Transformer

计算机视觉与模式识别 2025-05-02 v3

摘要

我们提出了 Latte,一种用于视频生成的新型潜在扩散 Transformer。Latte 首先从输入视频中提取时空 token,然后采用一系列 Transformer 块在潜在空间中对视频分布进行建模。为了对从视频中提取的大量 token 进行建模,我们从分解输入视频的空间和时间维度的视角引入了四种高效变体。为了提高生成视频的质量,我们通过严格的实验分析确定了 Latte 的最佳实践,包括视频片段 patch embedding、模型变体、时间步-类信息注入、时间位置嵌入和学习策略。我们的综合评估表明,Latte 在四个标准视频生成数据集(即 FaceForensics、SkyTimelapse、UCF101 和 Taichi-HD)上取得了 SOTA 性能。此外,我们将 Latte 扩展到文本到视频生成(T2V)任务,其中 Latte 取得了与近期 T2V 模型相竞争的结果。我们坚信,Latte 为未来将 Transformer 纳入扩散模型以进行视频生成的研究提供了有价值的见解。

关键词

引用

@article{arxiv.2401.03048,
  title  = {Latte: Latent Diffusion Transformer for Video Generation},
  author = {Xin Ma and Yaohui Wang and Xinyuan Chen and Gengyun Jia and Ziwei Liu and Yuan-Fang Li and Cunjian Chen and Yu Qiao},
  journal= {arXiv preprint arXiv:2401.03048},
  year   = {2025}
}

备注

Accepted by Transactions on Machine Learning Research 2025; Project Page: https://maxin-cn.github.io/latte_project