FlashVideo: 文本到视频生成中的快速推理框架
计算机视觉与模式识别
2024-01-03 v1
摘要
在机器学习不断发展的领域中,视频生成随着基于自回归的Transformer模型和扩散模型(以合成动态和真实场景而闻名)取得了显著进展。然而,这些模型常常面临推理时间过长的问题,即使生成像GIF这样的短视频片段也是如此。本文介绍了FlashVideo,一个专为快速文本到视频生成而设计的新颖框架。FlashVideo代表了RetNet架构在视频生成中的首次成功适配,为该领域带来了独特的方法。利用基于RetNet的架构,FlashVideo将长度为的序列的推理时间复杂度从降低到,显著加速了推理速度。此外,我们采用了一种无冗余的帧插值方法,提高了帧插值的效率。我们的综合实验表明,FlashVideo相比传统的基于自回归的Transformer模型实现了9.17倍的效率提升,其推理速度与基于BERT的Transformer模型处于同一数量级。
引用
@article{arxiv.2401.00869,
title = {FlashVideo: A Framework for Swift Inference in Text-to-Video Generation},
author = {Bin Lei and le Chen and Caiwen Ding},
journal= {arXiv preprint arXiv:2401.00869},
year = {2024}
}