LTX-Video:实时视频潜在扩散
计算机视觉与模式识别
2025-01-03 v1
摘要
我们介绍了LTX-Video,一种基于Transformer的潜在扩散模型,它通过无缝整合Video-VAE和去噪Transformer的职责,采用整体方法进行视频生成。与将这些组件视为独立模块的现有方法不同,LTX-Video旨在优化它们的交互以提高效率和质量。其核心是精心设计的Video-VAE,通过将分块操作从Transformer的输入移至VAE的输入,实现了1:192的高压缩比,每个token的时空下采样为32×32×8像素。在这种高度压缩的潜在空间中运行,使得Transformer能够高效地执行完整的时空自注意力,这对于生成具有时间一致性的高分辨率视频至关重要。然而,高压缩本质上限制了精细细节的表示。为了解决这个问题,我们的VAE解码器同时负责潜在到像素的转换和最终的去噪步骤,直接在像素空间中产生干净的结果。这种方法保留了生成精细细节的能力,而无需承担独立上采样模块的运行时成本。我们的模型支持多种用例,包括文本到视频和图像到视频生成,两种能力同时训练。它实现了快于实时的生成,在Nvidia H100 GPU上仅需2秒即可生成5秒的24 fps、768×512分辨率视频,优于所有现有类似规模的模型。源代码和预训练模型已公开,为可访问和可扩展的视频生成设立了新基准。
关键词
引用
@article{arxiv.2501.00103,
title = {LTX-Video: Realtime Video Latent Diffusion},
author = {Yoav HaCohen and Nisan Chiprut and Benny Brazowski and Daniel Shalem and Dudu Moshe and Eitan Richardson and Eran Levin and Guy Shiran and Nir Zabari and Ori Gordon and Poriya Panet and Sapir Weissbuch and Victor Kulikov and Yaki Bitterman and Zeev Melumian and Ofir Bibi},
journal= {arXiv preprint arXiv:2501.00103},
year = {2025}
}