中文

StoryGAN:用于故事可视化的序列条件GAN

计算机视觉与模式识别 2019-04-19 v2

摘要

我们提出一项新任务,称为故事可视化。给定多句段落,故事通过生成一系列图像来可视化,每句对应一幅图像。与视频生成不同,故事可视化较少关注生成图像(帧)间的连续性,而更多关注跨动态场景与角色的整体一致性——这一挑战尚未被任何单图像或视频生成方法解决。因此我们提出一种新的故事到图像序列生成模型StoryGAN,基于序列条件GAN(conditional GAN)框架。我们的模型独特之处在于其包含一个深度上下文编码器以动态追踪故事流,以及故事级与图像级两个判别器,以提升生成序列的图像质量与一致性。为评估模型,我们修改现有数据集以创建CLEVR-SV与Pororo-SV数据集。经验上,StoryGAN在图像质量、上下文一致性指标及人工评估上均优于最先进(state-of-the-art)模型。

关键词

引用

@article{arxiv.1812.02784,
  title  = {StoryGAN: A Sequential Conditional GAN for Story Visualization},
  author = {Yitong Li and Zhe Gan and Yelong Shen and Jingjing Liu and Yu Cheng and Yuexin Wu and Lawrence Carin and David Carlson and Jianfeng Gao},
  journal= {arXiv preprint arXiv:1812.02784},
  year   = {2019}
}