中文

文本驱动视频预测

计算机视觉与模式识别 2022-10-07 v1

摘要

当前视频生成模型通常将来自输入(如图像、文本)或潜空间(如噪声向量)的表征外观与运动的信号转换为连续帧,针对潜码采样引入的不确定性完成随机生成过程。然而,该生成模式缺乏对外观与运动的确定性约束,导致不可控且不理想的结果。为此,我们提出一项称为文本驱动视频预测(TVP)的新任务。该任务以首帧与文本描述为输入,旨在合成后续帧。具体而言,外观与运动分量分别由图像与描述提供。解决 TVP 任务的关键在于充分挖掘文本描述中潜在的运动信息,从而促进合理的视频生成。事实上,该任务本质上是因果问题,因为文本内容直接影响帧的运动变化。为探究文本在渐进运动信息因果推断中的能力,我们的 TVP 框架包含一个文本推断模块(TIM),产生逐步嵌入以调节后续帧的运动推断。特别地,一种融合全局运动语义的精炼机制保证了连贯生成。我们在 Something-Something V2 与 Single Moving MNIST 数据集上进行了充分实验。实验结果表明,我们的模型优于其他基线,验证了所提框架的有效性。

关键词

引用

@article{arxiv.2210.02872,
  title  = {Text-driven Video Prediction},
  author = {Xue Song and Jingjing Chen and Bin Zhu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2210.02872},
  year   = {2022}
}