中文

CIGLI:基于语言与图像的条件图像生成

计算机视觉与模式识别 2021-08-23 v1 计算与语言

摘要

多模态生成在近年来得到了广泛探索。当前的研究方向包括基于图像生成文本或反之。在本文中,我们提出了一项称为 CIGLI 的新任务:基于语言与图像的条件图像生成(Conditional Image Generation from Language and Image)。与文本-图像生成中基于文本生成图像不同,该任务需要从文本描述和图像提示生成图像。我们设计了一个新的数据集,以确保文本描述描述了两幅图像中的信息,且仅分析描述不足以生成图像。然后我们提出了一种新颖的语言-图像融合模型,在定量(自动)和定性(人工)评估中,其性能优于两种已有的基线方法。代码与数据集可在 https://github.com/vincentlux/CIGLI 获取。

关键词

引用

@article{arxiv.2108.08955,
  title  = {CIGLI: Conditional Image Generation from Language & Image},
  author = {Xiaopeng Lu and Lynnette Ng and Jared Fernandez and Hao Zhu},
  journal= {arXiv preprint arXiv:2108.08955},
  year   = {2021}
}

备注

5 pages