中文

DiffFaceSketch:基于草图引导隐扩散模型的高保真人脸图像合成

计算机视觉与模式识别 2023-02-28 v2 人工智能 机器学习 多媒体

摘要

从单色草图合成人脸图像是图像到图像翻译领域最基础的任务之一。然而,要(1)使模型学习几何与颜色等高维人脸特征,以及(2)兼顾输入草图的特性,仍然具有挑战性。现有方法常将草图作为间接输入(或辅助输入)来引导模型,导致草图特征丢失或几何信息被改变。本文中,我们提出一种草图引导隐扩散模型(Sketch-Guided Latent Diffusion Model, SGLDM),一种基于 LDM 并在草图-人脸配对数据集上训练的网络架构。我们采用多自动编码器(Multi-Auto-Encoder, AE)将人脸不同区域的不同输入草图从像素空间编码为隐空间中的特征图,从而在保留局部人脸细节几何相关信息的同时降低草图输入的维度。我们基于现有从图像提取边缘图的方法构建了一个草图-人脸配对数据集。随后我们引入随机区域抽象(Stochastic Region Abstraction, SRA),一种用于扩充数据集以提升 SGLDM 处理任意抽象程度草图输入鲁棒性的方法。评估研究表明,SGLDM 能从具有不同抽象程度的多类草图合成带有不同表情、面部配饰与发型的的高质量人脸图像。

关键词

引用

@article{arxiv.2302.06908,
  title  = {DiffFaceSketch: High-Fidelity Face Image Synthesis with Sketch-Guided Latent Diffusion Model},
  author = {Yichen Peng and Chunqi Zhao and Haoran Xie and Tsukasa Fukusato and Kazunori Miyata},
  journal= {arXiv preprint arXiv:2302.06908},
  year   = {2023}
}

备注

10 pages, 12 figures, and 2 tables, project page: https://puckikk1202.github.io/difffacesketch2023/