中文

基于动态 Token 雕刻的无训练高效视频生成

计算机视觉与模式识别 2025-11-25 v2

摘要

尽管视频扩散 Transformer(DiT)模型在生成质量方面取得显著进展,但其实际部署受限于巨大的计算需求。这一低效性源于两个关键挑战:自注意力机制相对于 token 长度的二次复杂度以及扩散模型的多步特性。为此,我们提出 Jenga,一种结合动态注意力雕刻和渐进分辨率生成的新型推理管道。我们的方法基于两个关键洞察:(1)早期去噪步骤不需要高分辨率的 latent,(2)后期步骤不需要稠密的注意力。Jenga 引入基于块的注意力机制,通过 3D 空间填充曲线动态选择相关 token 交互,同时采用渐进分辨率策略在生成过程中逐步增加 latent 分辨率。实验结果表明,Jenga 在多种最先进的视频扩散模型上实现显著加速,同时保持可比的生成质量(在 VBench 上实现 8.83 倍加速,仅 0.01% 的性能下降)。作为即插即用的解决方案,Jenga 在无需模型再训练的情况下,使现代硬件上的实用高质量视频生成从分钟级降低到秒级。代码:https://github.com/dvlab-research/Jenga

关键词

引用

@article{arxiv.2505.16864,
  title  = {Training-Free Efficient Video Generation via Dynamic Token Carving},
  author = {Yuechen Zhang and Jinbo Xing and Bin Xia and Shaoteng Liu and Bohao Peng and Xin Tao and Pengfei Wan and Eric Lo and Jiaya Jia},
  journal= {arXiv preprint arXiv:2505.16864},
  year   = {2025}
}

备注

NeurIPS 2025, Project Page: https://julianjuaner.github.io/projects/jenga/