基于布局的目标中心化图像生成
计算机视觉与模式识别
2020-12-04 v2 机器学习
图像与视频处理
摘要
尽管近期在单目标、单域图像生成方面取得了令人印象深刻的成果,但生成包含多个目标的复杂场景仍然具有挑战性。在本文中,我们从这样一个理念出发:模型必须能够理解单个目标以及目标之间的关系,才能很好地生成复杂场景。我们提出的布局到图像生成方法称为目标中心生成对抗网络(Object-Centric Generative Adversarial Network,OC-GAN),它依赖于一种新颖的场景图相似度模块(Scene-Graph Similarity Module,SGSM)。SGSM 学习场景中目标间空间关系的表示,从而使我们的模型提升了对布局的保真度。我们还对生成器的条件机制提出了改进,以增强其对目标实例的感知能力。除了提升图像质量外,我们的贡献缓解了先前方法中的两种失效模式:(1)在布局中没有对应边界框的情况下生成虚假目标;(2)布局中边界框重叠导致图像中目标被合并。大量的定量评估与消融实验证明了我们贡献的作用,我们的模型在 COCO-Stuff 和 Visual Genome 数据集上均优于先前的 SOTA 方法。最后,我们通过引入 SceneFID——广受欢迎的 Fréchet Inception Distance 度量的一种以目标为中心的改编版,来解决先前工作中所用评估度量的一个重要局限,该度量更适用于多目标图像。
引用
@article{arxiv.2003.07449,
title = {Object-Centric Image Generation from Layouts},
author = {Tristan Sylvain and Pengchuan Zhang and Yoshua Bengio and R Devon Hjelm and Shikhar Sharma},
journal= {arXiv preprint arXiv:2003.07449},
year = {2020}
}
备注
AAAI 2021