文本驱动视频预测
计算机视觉与模式识别
2022-10-07 v1
摘要
当前视频生成模型通常将来自输入(如图像、文本)或潜空间(如噪声向量)的表征外观与运动的信号转换为连续帧,针对潜码采样引入的不确定性完成随机生成过程。然而,该生成模式缺乏对外观与运动的确定性约束,导致不可控且不理想的结果。为此,我们提出一项称为文本驱动视频预测(TVP)的新任务。该任务以首帧与文本描述为输入,旨在合成后续帧。具体而言,外观与运动分量分别由图像与描述提供。解决 TVP 任务的关键在于充分挖掘文本描述中潜在的运动信息,从而促进合理的视频生成。事实上,该任务本质上是因果问题,因为文本内容直接影响帧的运动变化。为探究文本在渐进运动信息因果推断中的能力,我们的 TVP 框架包含一个文本推断模块(TIM),产生逐步嵌入以调节后续帧的运动推断。特别地,一种融合全局运动语义的精炼机制保证了连贯生成。我们在 Something-Something V2 与 Single Moving MNIST 数据集上进行了充分实验。实验结果表明,我们的模型优于其他基线,验证了所提框架的有效性。
引用
@article{arxiv.2210.02872,
title = {Text-driven Video Prediction},
author = {Xue Song and Jingjing Chen and Bin Zhu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2210.02872},
year = {2022}
}