中文

超越单片段的视频生成

计算机视觉与模式识别 2023-04-18 v1

摘要

我们解决长视频生成问题,即生成超出视频生成模型输出长度的视频。由于计算资源限制,视频生成模型只能生成相对于真实视频长度而言较短的视频片段。现有工作在推断时采用滑动窗口方法生成长视频,这通常局限于生成循环事件或同质内容。为生成涵盖多样内容与多个事件的长视频,我们提出使用额外引导来控制视频生成过程。我们进一步提出一种两阶段方法来解决该问题,使我们能够利用现有视频生成模型在小时间窗口内生成高质量视频,同时基于输入引导对视频进行整体建模。所提方法与现有聚焦于在固定时间窗口内生成逼真视频的视频生成工作互补。在具挑战性的真实世界视频上的大量实验验证了所提方法的优势,其在客观指标上比最先进水平提升多达 9.5%,且在超过 80% 的情况下被用户偏好。

关键词

引用

@article{arxiv.2304.07483,
  title  = {Video Generation Beyond a Single Clip},
  author = {Hsin-Ping Huang and Yu-Chuan Su and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2304.07483},
  year   = {2023}
}