基于 CLIP 引导的像素级优化迈向实时文本生成视频
计算机视觉与模式识别
2022-10-25 v1 机器学习
摘要
我们提出一种基于一系列给定语言描述生成视频的方法。视频帧被顺序生成,并通过 CLIP 图文编码器的引导进行优化;在迭代语言描述时,将当前描述的权重置于其他描述之上。与通常通过图像生成器模型本身进行优化(往往计算繁重)不同,所提方法直接在像素级计算 CLIP 损失,以适合近实时系统的速度获得总体内容。该方法可生成最高 720p 分辨率、可变帧率和任意宽高比的视频,速率为每秒 1-2 帧。请访问我们的网站观看视频并获取开源代码:https://pschaldenbrand.github.io/text2video/ 。
引用
@article{arxiv.2210.12826,
title = {Towards Real-Time Text2Video via CLIP-Guided, Pixel-Level Optimization},
author = {Peter Schaldenbrand and Zhixuan Liu and Jean Oh},
journal= {arXiv preprint arXiv:2210.12826},
year = {2022}
}