中文

面向长视频的块级生成

计算机视觉与模式识别 2024-12-02 v1

摘要

生成持续时长的视频始终是一个重大挑战,由于时空域的内在复杂性以及计算大规模张量所需的巨大GPU内存。尽管基于扩散的生成模型在视频生成任务中取得了最先进的性能,但它们通常在预定义的视频分辨率和长度下训练。在推理期间,必须首先指定具有特定分辨率和长度的噪声张量,模型将同时对整个视频张量进行去噪,包括所有帧。这一方法在指定的分辨率和/或长度超过一定限制时容易引发内存不足(OOM)问题。解决这一问题的一个方法是以强大的跨块时空关系自回归地生成许多短视频块,然后将其拼接以形成长视频。在这种方法中,将长视频生成任务划分为多个短视频生成子任务,每个子任务的计算成本降低到可行水平。本文我们对采用自回归逐块策略进行的长视频生成进行了详细调查。我们解决了将短图像到视频模型应用于长视频任务时所导致的常见问题,并设计一种高效的k步搜索解决方案来缓解这些问题。

关键词

引用

@article{arxiv.2411.18668,
  title  = {Towards Chunk-Wise Generation for Long Videos},
  author = {Siyang Zhang and Ser-Nam Lim},
  journal= {arXiv preprint arXiv:2411.18668},
  year   = {2024}
}