想象这个!从脚本到构图再到视频
计算机视觉与模式识别
2018-04-11 v1 计算与语言
信息检索
机器学习
摘要
用自然语言表达的场景,以实体的真实布局和外观想象出来,是对空间、视觉和语义世界知识的终极检验。为此,我们提出组合、检索与融合网络(CRAFT),一种能够从视频-字幕数据中学习此类知识,并在由新颖字幕生成视频时应用该知识的模型。CRAFT显式预测所提及实体(角色和物体)的时间布局,从视频数据库中检索时空实体片段并将其融合以生成场景视频。我们的贡献包括CRAFT各组件的顺序训练,同时联合建模布局与外观,以及鼓励学习用于检索的组合式表示的损失。我们在对字幕的语义保真度、组合一致性和视觉质量上评估CRAFT。CRAFT优于直接像素生成方法,并能很好地泛化到未见过的字幕和无需文本标注的未见视频数据库。我们在FLINTSTONES上演示CRAFT,这是一个拥有超过25000个视频的新近丰富标注视频-字幕数据集。欲窥CRAFT生成视频之一斑,见 https://youtu.be/688Vv86n0z8。
引用
@article{arxiv.1804.03608,
title = {Imagine This! Scripts to Compositions to Videos},
author = {Tanmay Gupta and Dustin Schwenk and Ali Farhadi and Derek Hoiem and Aniruddha Kembhavi},
journal= {arXiv preprint arXiv:1804.03608},
year = {2018}
}
备注
Supplementary material included