中文

基于布局的目标中心化图像生成

计算机视觉与模式识别 2020-12-04 v2 机器学习 图像与视频处理

摘要

尽管近期在单目标、单域图像生成方面取得了令人印象深刻的成果,但生成包含多个目标的复杂场景仍然具有挑战性。在本文中,我们从这样一个理念出发:模型必须能够理解单个目标以及目标之间的关系,才能很好地生成复杂场景。我们提出的布局到图像生成方法称为目标中心生成对抗网络(Object-Centric Generative Adversarial Network,OC-GAN),它依赖于一种新颖的场景图相似度模块(Scene-Graph Similarity Module,SGSM)。SGSM 学习场景中目标间空间关系的表示,从而使我们的模型提升了对布局的保真度。我们还对生成器的条件机制提出了改进,以增强其对目标实例的感知能力。除了提升图像质量外,我们的贡献缓解了先前方法中的两种失效模式:(1)在布局中没有对应边界框的情况下生成虚假目标;(2)布局中边界框重叠导致图像中目标被合并。大量的定量评估与消融实验证明了我们贡献的作用,我们的模型在 COCO-Stuff 和 Visual Genome 数据集上均优于先前的 SOTA 方法。最后,我们通过引入 SceneFID——广受欢迎的 Fréchet Inception Distance 度量的一种以目标为中心的改编版,来解决先前工作中所用评估度量的一个重要局限,该度量更适用于多目标图像。

关键词

引用

@article{arxiv.2003.07449,
  title  = {Object-Centric Image Generation from Layouts},
  author = {Tristan Sylvain and Pengchuan Zhang and Yoshua Bengio and R Devon Hjelm and Shikhar Sharma},
  journal= {arXiv preprint arXiv:2003.07449},
  year   = {2020}
}

备注

AAAI 2021