具有增强物体外观的上下文感知布局到图像生成
计算机视觉与模式识别
2021-03-23 v1
摘要
布局到图像(L2I)生成模型旨在根据给定布局生成包含多个物体(things)与自然背景(stuff)的复杂图像。基于生成对抗网络(GANs)的近期进展,现有 L2I 模型已取得很大进步。然而,对其生成图像的仔细检视揭示了两个主要局限:(1)物体间以及物体与背景间的关系常被破坏;(2)每个物体的外观通常失真,缺乏与该物体类别相关的关键定义特征。我们认为这些是由其生成器中缺乏上下文感知的物体与背景特征编码,以及判别器中缺乏位置敏感的外观表示所致。为解决这些局限,本工作提出两个新模块。首先,在生成器中引入上下文感知特征变换模块,以确保生成的物体或背景特征编码能感知场景中其他共存的物体/背景。其次,我们不使用位置不敏感的图像特征输入判别器,而是利用由生成物体图像的特征图计算的 Gram 矩阵来保留位置敏感信息,从而显著增强物体外观。大量实验表明,所提方法在 COCO-Thing-Stuff 和 Visual Genome 基准上达到了最先进的性能。
引用
@article{arxiv.2103.11897,
title = {Context-Aware Layout to Image Generation with Enhanced Object Appearance},
author = {Sen He and Wentong Liao and Michael Ying Yang and Yongxin Yang and Yi-Zhe Song and Bodo Rosenhahn and Tao Xiang},
journal= {arXiv preprint arXiv:2103.11897},
year = {2021}
}
备注
CVPR 2021