CIGLI:基于语言与图像的条件图像生成
计算机视觉与模式识别
2021-08-23 v1 计算与语言
摘要
多模态生成在近年来得到了广泛探索。当前的研究方向包括基于图像生成文本或反之。在本文中,我们提出了一项称为 CIGLI 的新任务:基于语言与图像的条件图像生成(Conditional Image Generation from Language and Image)。与文本-图像生成中基于文本生成图像不同,该任务需要从文本描述和图像提示生成图像。我们设计了一个新的数据集,以确保文本描述描述了两幅图像中的信息,且仅分析描述不足以生成图像。然后我们提出了一种新颖的语言-图像融合模型,在定量(自动)和定性(人工)评估中,其性能优于两种已有的基线方法。代码与数据集可在 https://github.com/vincentlux/CIGLI 获取。
引用
@article{arxiv.2108.08955,
title = {CIGLI: Conditional Image Generation from Language & Image},
author = {Xiaopeng Lu and Lynnette Ng and Jared Fernandez and Hao Zhu},
journal= {arXiv preprint arXiv:2108.08955},
year = {2021}
}
备注
5 pages