中文

面向人脸图像合成的语义部件自动生成

计算机视觉与模式识别 2023-07-12 v1 人工智能

摘要

语义图像合成(SIS)指的是在给定定义物体类别空间布局的语义分割掩码的条件下生成逼真图像的问题。文献中多数方法除生成图像的质量外,致力于寻找增加风格即纹理方面生成多样性的解决方案。然而它们都忽视了一个不同的特征,即操控掩码所提供布局的可能性。目前唯一的方式是通过图形用户界面的手动操作。本文中,我们描述一种网络架构以解决自动操控或生成语义分割掩码中物体类别形状的问题,特别关注人脸。我们提出的模型允许将掩码按类别嵌入潜空间,其中每个类别的嵌入可独立编辑。随后,一个双向 LSTM 模块与卷积解码器输出一个新的、局部被操控的掩码。我们在 CelebMask-HQ 数据集上报告了定量与定性结果,表明我们的模型既能在类别级别忠实重建也能修改分割掩码。此外,我们展示我们的模型可置于 SIS 生成器之前,为形状与纹理的完全自动生成控制开辟了道路。代码见 https://github.com/TFonta/Semantic-VAE。

关键词

引用

@article{arxiv.2307.05317,
  title  = {Automatic Generation of Semantic Parts for Face Image Synthesis},
  author = {Tomaso Fontanini and Claudio Ferrari and Massimo Bertozzi and Andrea Prati},
  journal= {arXiv preprint arXiv:2307.05317},
  year   = {2023}
}

备注

Preprint, accepted for publication at ICIAP 2023