中文

GILT:从长文本生成图像

计算机视觉与模式识别 2019-01-09 v1 人工智能 机器学习

摘要

创建反映长文本内容的图像是一个需要创造力的复杂过程。例如,基于书籍简介创建书封面或电影海报,或基于食谱创建食物图像。在本文中,我们提出从不直接描述图像视觉内容的长文本生成图像这一新任务。为此,我们构建了一个以食谱为条件生成食物的高分辨率 256 ×\times 256 图像的系统。食谱文本(不含标题)与图像视觉内容之间的关系是模糊的,且食谱的文本结构复杂,由两部分(食材和步骤)组成,均包含多个句子。我们使用 recipe1M 数据集来训练和评估基于 StackGAN-v2 架构的模型。

关键词

引用

@article{arxiv.1901.02404,
  title  = {GILT: Generating Images from Long Text},
  author = {Ori Bar El and Ori Licht and Netanel Yosephian},
  journal= {arXiv preprint arXiv:1901.02404},
  year   = {2019}
}