如何制作披萨:学习基于组合图层的 GAN 模型
计算机视觉与模式识别
2019-06-10 v1
摘要
一份食谱是一组用于准备特定菜肴的有序操作说明。从视觉角度看,每一个操作步都可视为通过添加额外对象(例如添加一种食材)或改变已有对象的外观(例如烹饪菜肴)来改变菜肴视觉外观的方式。在本文中,我们旨在通过构建一个反映这一逐步过程的生成模型来教会机器如何制作披萨。为此,我们学习可组合的模块操作,这些操作能够添加或移除特定食材。每个算子被设计为生成对抗网络(GAN)。在仅给定弱图像级监督的情况下,这些算子被训练为生成需要被添加至现有图像或从现有图像中移除的视觉图层。所提出的模型能够通过按正确顺序依次应用相应的移除模块,将图像分解为有序的图层序列。在合成与真实披萨图像上的实验结果表明,我们提出的模型能够:(1) 以弱监督方式分割披萨配料,(2) 通过揭示被其遮挡的下方内容来移除它们(即修复),以及 (3) 在没有任何深度排序监督的情况下推断配料的顺序。代码、数据与模型均已在线提供。
引用
@article{arxiv.1906.02839,
title = {How to make a pizza: Learning a compositional layer-based GAN model},
author = {Dim P. Papadopoulos and Youssef Tamaazousti and Ferda Ofli and Ingmar Weber and Antonio Torralba},
journal= {arXiv preprint arXiv:1906.02839},
year = {2019}
}
备注
CVPR 2019