中文

TokensGen: 利用压缩令牌生成长视频

计算机视觉与模式识别 2025-07-22 v1

摘要

生成一致的长视频是一个复杂的挑战:虽然基于扩散的生成模型能生成视觉上令人印象深刻的短视频片段,但将其扩展到更长的时长常常导致内存瓶颈和长期不一致性。本文提出 TokensGen,一种利用压缩令牌解决这些问题的两阶段新颖框架。我们的方法将长视频生成分解为三个核心任务:(1) 片段内语义控制,(2) 长期一致性控制,以及 (3) 片段间平滑过渡。首先,我们训练了 To2V (Token-to-Video),一个由文本和视频令牌引导的短视频扩散模型,并配备了一个视频分词器,将短视频片段压缩为语义丰富的令牌。其次,我们引入了 T2To (Text-to-Token),一个一次性生成所有令牌的视频令牌扩散 Transformer,确保跨片段的全局一致性。最后,在推理过程中,一种自适应的 FIFO-Diffusion 策略无缝连接相邻片段,减少边界伪影并增强平滑过渡。实验结果表明,我们的方法显著增强了长期时间和内容一致性,且未引入过高的计算开销。通过利用压缩令牌和预训练的短视频模型,我们的方法为长视频生成提供了一种可扩展、模块化的解决方案,为故事叙述、电影制作和沉浸式模拟开辟了新的可能性。请参见我们的项目页面:https://vicky0522.github.io/tokensgen-webpage/。

关键词

引用

@article{arxiv.2507.15728,
  title  = {TokensGen: Harnessing Condensed Tokens for Long Video Generation},
  author = {Wenqi Ouyang and Zeqi Xiao and Danni Yang and Yifan Zhou and Shuai Yang and Lei Yang and Jianlou Si and Xingang Pan},
  journal= {arXiv preprint arXiv:2507.15728},
  year   = {2025}
}

备注

Project page: https://vicky0522.github.io/tokensgen-webpage/