感知变化的语义图像合成
计算机视觉与模式识别
2024-01-23 v1
摘要
语义图像合成(SIS)旨在生成与给定条件语义布局对齐的逼真图像,近年来取得了显著进展。尽管图像层面的多样性已被大量讨论,类级别的模态崩塌在当前算法中广泛存在。因此,我们提出 SIS 的一项新要求以实现更逼真的图像——感知变化(variation-aware),其由类间变化与类内变化构成。类间变化是不同语义类之间的多样性,而类内变化强调同一类内部的多样性。通过分析,我们发现当前算法隐式地包含了类间变化,但类内变化仍显不足。进一步,我们引入两种简单方法以通过语义噪声与位置编码实现具有更高类内变化的感知变化语义图像合成(VASIS)。我们将方法与若干最先进算法结合,实验结果表明我们的模型生成了更自然的图像,并取得了略优于对应方法的 FID 和/或 mIoU。我们的代码与模型将公开可用。
引用
@article{arxiv.2301.10551,
title = {Variation-Aware Semantic Image Synthesis},
author = {Mingle Xu and Jaehwan Lee and Sook Yoon and Hyongsuk Kim and Dong Sun Park},
journal= {arXiv preprint arXiv:2301.10551},
year = {2024}
}
备注
12 pages, 3 figures, 5 tables