MPG:基于条件式 StyleGAN 的多配料披萨图像生成器
计算机视觉与模式识别
2021-10-07 v2 计算与语言
摘要
多标签条件图像生成是计算机视觉中一个具有挑战性的问题。本文提出多配料披萨生成器(Multi-ingredient Pizza Generator, MPG),一种用于合成多标签图像的条件生成对抗网络(GAN)框架。我们基于最先进的 GAN 结构 StyleGAN2 设计 MPG,其中开发了一种新的条件化技术,通过强制中间特征图学习尺度级标签信息。由于多标签图像生成问题的复杂性,我们还通过预测对应配料来正则化合成图像,并鼓励判别器区分匹配图像与不匹配图像。为验证 MPG 的有效性,我们在 Pizza10 上进行了测试,这是一个经过精细标注的多配料披萨图像数据集。MPG 能成功生成具有期望配料的照片级真实披萨图像。该框架可轻松扩展到其他多标签图像生成场景。
引用
@article{arxiv.2012.02821,
title = {MPG: A Multi-ingredient Pizza Image Generator with Conditional StyleGANs},
author = {Fangda Han and Guoyao Hao and Ricardo Guerrero and Vladimir Pavlovic},
journal= {arXiv preprint arXiv:2012.02821},
year = {2021}
}