中文

基于检索的空间自适应归一化用于语义图像合成

计算机视觉与模式识别 2022-04-07 v1

摘要

语义图像合成是一项具有许多实际应用的挑战性任务。尽管利用空间自适应归一化的语义图像合成已取得显著进展,现有方法在粗粒度引导(如语义类别)下对特征激活进行归一化。然而,同一语义对象的不同部分(如汽车的车轮和车窗)在结构与纹理上差异很大,由于缺少细粒度引导,通常不可避免地产生模糊的合成结果。本文提出一种新颖的归一化模块,称为基于检索的空间自适应归一化(RESAIL),用于将像素级细粒度引导引入归一化架构。具体而言,我们首先提出一种检索范式:从训练集中找到与每个测试语义掩码形状最相似且语义类别相同的内容块。然后,提出 RESAIL 利用检索到的块来引导对应区域的特征归一化,能够提供像素级细粒度引导,从而大幅缓解模糊合成结果。此外,失真真值图像也用作基于检索的引导的替代来进行特征归一化,进一步有益于模型训练并提升生成图像的视觉质量。在多个具挑战性数据集上的实验表明,我们的 RESAIL 在定量指标、视觉质量和主观评价方面均优于当前最优方法。源代码与预训练模型将公开可用。

关键词

引用

@article{arxiv.2204.02854,
  title  = {Retrieval-based Spatially Adaptive Normalization for Semantic Image Synthesis},
  author = {Yupeng Shi and Xiao Liu and Yuxiang Wei and Zhongqin Wu and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2204.02854},
  year   = {2022}
}