xGen-VideoSyn-1:基于压缩表征的高保真文本到视频生成
计算机视觉与模式识别
2024-09-04 v2 人工智能
摘要
我们提出xGen-VideoSyn-1,一种能够生成逼真场景的文本到视频(T2V)生成模型。基于OpenAI的Sora等最新进展,我们探索了潜在扩散模型(LDM)架构,引入视频变分自编码器(VidVAE)。VidVAE对视频数据在空间和时间上进行压缩,显著减少了视觉标记的长度以及生成长序列视频的计算需求。为进一步解决计算成本问题,我们提出一种保持视频片段之间时间一致性的分割-合并策略。我们的扩散转换器(DiT)模型包含空间和时间自注意力层,能够在不同时间范围和宽高比上实现稳健的泛化。我们设计了从头开始的数据处理管道,收集了超过1300万高质量视频文本对。管道包括裁剪、文本检测、运动估计、审美评分和基于我们内部视频-LLM模型的密集描述等多个步骤。训练VidVAE和DiT模型分别需要约40和642个H100天。该模型支持以端到端方式生成超过14秒、720p分辨率的视频,并在多个指标上表现出竞争力。
引用
@article{arxiv.2408.12590,
title = {xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations},
author = {Can Qin and Congying Xia and Krithika Ramakrishnan and Michael Ryoo and Lifu Tu and Yihao Feng and Manli Shu and Honglu Zhou and Anas Awadalla and Jun Wang and Senthil Purushwalkam and Le Xue and Yingbo Zhou and Huan Wang and Silvio Savarese and Juan Carlos Niebles and Zeyuan Chen and Ran Xu and Caiming Xiong},
journal= {arXiv preprint arXiv:2408.12590},
year = {2024}
}
备注
Accepted by ECCV24 AI4VA