面向表情操控的语义分割与层次化生成对抗网络统一架构
计算机视觉与模式识别
2021-12-10 v1
摘要
仅改变目标属性来编辑面部表情,是生成对抗网络(GAN)在图像操控领域一个长期存在的研究难题。现有方法大多仅依赖一个全局生成器,通常会在改变目标属性的同时改变非目标属性。近来,由处理整幅图像的全局网络和聚焦局部区域的多个局部网络组成的层次化网络展现出成功潜力。然而,这些方法通过以稀疏面部关键点为中心的边界框来提取局部区域,这种方式不可微、不准确且不真实。因此,该解决方案并非最优,会引入非目标伪影,降低合成图像的整体质量。此外,近期研究表明面部属性与局部语义区域之间存在强相关性。为利用这一关系,我们设计了一种语义分割与层次化GAN的统一架构。我们框架的一个独特优势在于:前向传播时,语义分割网络为生成模型提供条件;反向传播时,来自层次化GAN的梯度传播至语义分割网络,这使得我们的框架成为一个端到端可微的架构。这使两种架构能够相互受益。为展示其优势,我们在两个具有挑战性的面部表情翻译基准数据集(AffectNet 和 RaFD)以及一个语义分割基准数据集(CelebAMask-HQ)上,基于两种流行架构(BiSeNet 和 UNet)评估了我们的方法。我们在面部语义分割和面部表情操控任务上进行的广泛定量与定性评估,验证了我们的工作相对于现有最先进方法的有效性。
引用
@article{arxiv.2112.04603,
title = {A Unified Architecture of Semantic Segmentation and Hierarchical Generative Adversarial Networks for Expression Manipulation},
author = {Rumeysa Bodur and Binod Bhattarai and Tae-Kyun Kim},
journal= {arXiv preprint arXiv:2112.04603},
year = {2021}
}