利用关系进行复杂场景图像生成
计算机视觉与模式识别
2021-04-02 v1
摘要
生成对抗网络(GANs)的显著进展促进了基于语言输入的逼真单物体图像生成。然而,复杂场景生成(多个物体间存在多种交互)仍受困于布局混乱与物体畸变,原因在于布局与外观的多样配置。现有方法大多以物体驱动,忽略了在复杂场景图像中起重要作用的相互关系。本文探索关系感知的复杂场景图像生成,其中多个物体作为场景图相互关联。借助关系,我们在生成框架中提出三项主要改进。首先,通过联合考虑物体语义与相互关系推断合理空间布局。相较于标准位置回归,我们表明相对尺度与距离是可更可靠的目标。其次,由于物体间关系显著影响物体外观,我们设计了关系引导生成器以生成反映其关系的物体。第三,提出一种新颖的场景图判别器以保证生成图像与输入场景图的一致性。我们的方法倾向于合成合理布局与物体,尊重图像中多物体的相互作用。在 Visual Genome 与 HICO-DET 数据集上的实验结果表明,所提方法在 IS 与 FID 指标上显著优于先前方法。基于用户研究与视觉检查,我们的方法在生成复杂场景的逻辑布局与外观上更为有效。
引用
@article{arxiv.2104.00356,
title = {Exploiting Relationship for Complex-scene Image Generation},
author = {Tianyu Hua and Hongdong Zheng and Yalong Bai and Wei Zhang and Xiao-Ping Zhang and Tao Mei},
journal= {arXiv preprint arXiv:2104.00356},
year = {2021}
}