中文

勾勒未来(STF):将条件控制技术应用于文本到视频模型

计算机视觉与模式识别 2023-05-11 v1 人工智能

摘要

视频内容的激增需要高效且灵活的基于神经网络的方法来生成新视频内容。本文提出一种将零样本文本到视频生成与 ControlNet 相结合以改进这些模型输出的新方法。我们的方法以多张草图帧作为输入,并生成匹配这些帧流转的视频输出,该方法构建于 Text-to-Video Zero 架构之上并引入 ControlNet 以实现额外输入条件。通过先对输入草图间进行帧插值,随后使用新插值帧视频作为控制技术运行 Text-to-Video Zero,我们兼具了零样本文本到视频生成与 ControlNet 所提供鲁棒控制的优势。实验表明,我们的方法擅长生成高质量且高度一致的视频内容,能更准确地贴合用户在视频中对主体预期的运动。我们提供了综合资源包,包括演示视频、项目网站、开源 GitHub 仓库与 Colab playground,以促进对所提方法的进一步研究与应用。

关键词

引用

@article{arxiv.2305.05845,
  title  = {Sketching the Future (STF): Applying Conditional Control Techniques to Text-to-Video Models},
  author = {Rohan Dhesikan and Vignesh Rajmohan},
  journal= {arXiv preprint arXiv:2305.05845},
  year   = {2023}
}

备注

9 pages, 8 figures