中文

展示内容与指示方式:基于多模态条件的视频合成

计算机视觉与模式识别 2022-03-08 v1 人工智能 机器学习

摘要

大多数条件视频合成方法使用单一模态作为条件,这存在重大局限。例如,以图像为条件的模型难以生成用户期望的特定运动轨迹,因为无法提供运动信息。反之,语言信息可以描述期望的运动,却无法精确界定视频内容。本文提出一种多模态视频生成框架,可利用联合或单独提供的文本与图像。我们借助视频量化表示的最新进展,采用以多模态为输入的双向 transformer 预测离散视频表示。为提升视频质量与一致性,我们提出一种经自学习训练的新视频 token 以及一种改进的掩码预测算法用于采样视频 token。我们引入文本增强以提升文本表示的鲁棒性与生成视频的多样性。我们的框架可融合分割掩码、草图、部分遮挡图像等多种视觉模态,并能生成远长于训练所用长度的序列。此外,我们的模型可提取文本提示所指示的视觉信息,例如“图一中的物体向东北方向移动”,并生成相应视频。我们在三个公开数据集及一个新收集的标注面部属性数据集上评估,在全部四个数据集上均取得了最先进的生成结果。

关键词

引用

@article{arxiv.2203.02573,
  title  = {Show Me What and Tell Me How: Video Synthesis via Multimodal Conditioning},
  author = {Ligong Han and Jian Ren and Hsin-Ying Lee and Francesco Barbieri and Kyle Olszewski and Shervin Minaee and Dimitris Metaxas and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2203.02573},
  year   = {2022}
}

备注

Accepted to CVPR 2022