中文

可控多域语义艺术作品合成

计算机视觉与模式识别 2023-08-22 v1 图形学

摘要

我们提出了一种从语义布局进行多域艺术作品合成的新框架。该具有挑战性任务的主要局限之一是缺乏用于艺术合成的公开可用分割数据集。为解决此问题,我们提出了一个称为 ArtSem 的数据集,包含来自 4 个不同领域的 40,000 张艺术作品图像及其对应的语义标签图。我们首先从风景摄影中提取语义图,然后提出一种基于条件生成对抗网络(GAN)的方法,从语义图生成高质量艺术作品,且无需配对训练数据。此外,我们提出了一种艺术作品合成模型,使用依赖于域的变分编码器进行高质量多域合成。该模型通过一种简单而有效的归一化方法得到改进和补充,该方法基于联合归一化语义与风格,我们称之为空间风格自适应归一化(Spatially STyle-Adaptive Normalization, SSTAN)。与之前仅以语义布局作为输入的模型不同,我们的模型能够学习风格与语义信息的联合表示,从而提升艺术图像合成的生成质量。结果表明,我们的模型学习在潜空间中分离各域,因此通过识别分离不同域的超平面,我们还能对合成艺术作品进行细粒度控制。通过结合我们提出的数据集与方法,我们能够生成比现有方法质量更高的用户可控艺术作品。

关键词

引用

@article{arxiv.2308.10111,
  title  = {Controllable Multi-domain Semantic Artwork Synthesis},
  author = {Yuantian Huang and Satoshi Iizuka and Edgar Simo-Serra and Kazuhiro Fukui},
  journal= {arXiv preprint arXiv:2308.10111},
  year   = {2023}
}

备注

15 pages, accepted by CVMJ, to appear