中文

FlashVideo: 文本到视频生成中的快速推理框架

计算机视觉与模式识别 2024-01-03 v1

摘要

在机器学习不断发展的领域中,视频生成随着基于自回归的Transformer模型和扩散模型(以合成动态和真实场景而闻名)取得了显著进展。然而,这些模型常常面临推理时间过长的问题,即使生成像GIF这样的短视频片段也是如此。本文介绍了FlashVideo,一个专为快速文本到视频生成而设计的新颖框架。FlashVideo代表了RetNet架构在视频生成中的首次成功适配,为该领域带来了独特的方法。利用基于RetNet的架构,FlashVideo将长度为LL的序列的推理时间复杂度从O(L2)\mathcal{O}(L^2)降低到O(L)\mathcal{O}(L),显著加速了推理速度。此外,我们采用了一种无冗余的帧插值方法,提高了帧插值的效率。我们的综合实验表明,FlashVideo相比传统的基于自回归的Transformer模型实现了9.17倍的效率提升,其推理速度与基于BERT的Transformer模型处于同一数量级。

关键词

引用

@article{arxiv.2401.00869,
  title  = {FlashVideo: A Framework for Swift Inference in Text-to-Video Generation},
  author = {Bin Lei and le Chen and Caiwen Ding},
  journal= {arXiv preprint arXiv:2401.00869},
  year   = {2024}
}