CookGAN:从食材合成餐食图像
计算机视觉与模式识别
2020-02-27 v1
摘要
在这项工作中,我们提出一种基于生成式深度模型的新计算框架,用于从文本形式的食材列表合成照片级真实的餐食图像。先前从文本合成图像的工作通常依赖预训练文本模型提取文本特征,随后使用以文本特征为条件的生成神经网络(GAN)来生成真实图像。这些工作主要关注生成空间上紧凑且定义明确的物体类别,如鸟类或花卉,但餐食图像明显更复杂,由多种食材组成,其外观和空间特性还因烹饪方法而改变。为从食材生成真实餐食图像,我们提出 Cook 生成对抗网络(CookGAN),CookGAN 首先构建基于注意力的食材-图像关联模型,然后将其用于条件化一个负责合成餐食图像的生成神经网络。此外,加入循环一致性约束以进一步提升图像质量并控制外观。实验表明我们的模型能够生成与食材相对应的餐食图像。
引用
@article{arxiv.2002.11493,
title = {CookGAN: Meal Image Synthesis from Ingredients},
author = {Fangda Han and Ricardo Guerrero and Vladimir Pavlovic},
journal= {arXiv preprint arXiv:2002.11493},
year = {2020}
}
备注
10 pages, 5 figures, accepted by WACV 2020. arXiv admin note: substantial text overlap with arXiv:1905.13149