中文

基于 CLIP 引导的像素级优化迈向实时文本生成视频

计算机视觉与模式识别 2022-10-25 v1 机器学习

摘要

我们提出一种基于一系列给定语言描述生成视频的方法。视频帧被顺序生成,并通过 CLIP 图文编码器的引导进行优化;在迭代语言描述时,将当前描述的权重置于其他描述之上。与通常通过图像生成器模型本身进行优化(往往计算繁重)不同,所提方法直接在像素级计算 CLIP 损失,以适合近实时系统的速度获得总体内容。该方法可生成最高 720p 分辨率、可变帧率和任意宽高比的视频,速率为每秒 1-2 帧。请访问我们的网站观看视频并获取开源代码:https://pschaldenbrand.github.io/text2video/ 。

关键词

引用

@article{arxiv.2210.12826,
  title  = {Towards Real-Time Text2Video via CLIP-Guided, Pixel-Level Optimization},
  author = {Peter Schaldenbrand and Zhixuan Liu and Jean Oh},
  journal= {arXiv preprint arXiv:2210.12826},
  year   = {2022}
}